Распознавание изображений
诺玛AI поддерживает визуальный ввод для мультимодальных моделей, позволяя анализировать изображения, скриншоты, документы и видео.
Поддерживаемые модели#
Модель
Изображения
Видео
Описание
`openai/gpt-4o`
✅
—
Высококачественный анализ изображений
`openai/gpt-4o-mini`
✅
—
Быстрый анализ изображений
`anthropic/claude-sonnet-4.6`
✅
—
Мощное понимание документов и кода
`google/gemini-pro-compatible-flash-lite-preview`
✅
✅
Универсальная мультимодальность
`google/gemini-pro-compatible-pro-preview`
✅
✅
Самые мощные мультимодальные рассуждения
Анализ изображений#
Отправка изображения по URL
cURL
curl https://as.apinoma.com/v1/chat/completions \
-H "Authorization: Bearer $APINOMA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-4o",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Опиши содержимое этого изображения"},
{"type": "image_url", "image_url": {"url": "https://example.com/photo.jpg"}}
]
}]
}'Python
TypeScript
Отправка изображения через Base64
Подходит для локальных файлов или скриншотов:
Уровень детализации изображения#
Точность анализа управляется параметром `detail`:
Значение
Описание
Сценарий применения
`auto`
Автоматический выбор (по умолчанию)
Общие сценарии
`low`
Низкая точность, быстрее
Простая классификация, распознавание меток
`high`
Высокая точность, детальнее
OCR документов, детальный анализ
{
"type": "image_url",
"image_url": {
"url": "https://example.com/document.jpg",
"detail": "high" # Режим высокой точности
}
}Сравнение нескольких изображений#
В одном запросе можно отправить несколько изображений:
response = client.chat.completions.create(
model="openai/gpt-4o",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Сравни различия между этими двумя изображениями"},
{"type": "image_url", "image_url": {"url": "https://example.com/before.jpg"}},
{"type": "image_url", "image_url": {"url": "https://example.com/after.jpg"}}
]
}]
)Визуальный ввод по протоколу Anthropic#
import anthropic
client = anthropic.Anthropic(
base_url="https://as.apinoma.com/anthropic",
api_key="<ваш APINOMA_API_KEY>"
)
message = client.messages.create(
model="anthropic/claude-sonnet-4.6",
max_tokens=1024,
messages=[{
"role": "user",
"content": [
{
"type": "image",
"source": {
"type": "base64",
"media_type": "image/jpeg",
"data": image_data
}
},
{"type": "text", "text": "Опиши это изображение"}
]
}]
)Типичные сценарии использования#
- OCR документов — извлечение текста и таблиц из изображений
- Анализ скриншотов кода — анализ кода на скриншоте и рекомендации по исправлению
- Ревью UI — анализ дизайна и компоновки интерфейса
- Чтение диаграмм — анализ графиков данных и визуализаций
- Распознавание товаров — распознавание объектов и сцен на изображениях
Последнее обновление: 23 июня 2026 г.