Распознавание изображений

诺玛AI поддерживает визуальный ввод для мультимодальных моделей, позволяя анализировать изображения, скриншоты, документы и видео.

Поддерживаемые модели#

Модель

Изображения

Видео

Описание

`openai/gpt-4o`

Высококачественный анализ изображений

`openai/gpt-4o-mini`

Быстрый анализ изображений

`anthropic/claude-sonnet-4.6`

Мощное понимание документов и кода

`google/gemini-pro-compatible-flash-lite-preview`

Универсальная мультимодальность

`google/gemini-pro-compatible-pro-preview`

Самые мощные мультимодальные рассуждения

Анализ изображений#

Отправка изображения по URL

cURL

Код
curl https://as.apinoma.com/v1/chat/completions \
  -H "Authorization: Bearer $APINOMA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-4o",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Опиши содержимое этого изображения"},
        {"type": "image_url", "image_url": {"url": "https://example.com/photo.jpg"}}
      ]
    }]
  }'

Python

TypeScript

Отправка изображения через Base64

Подходит для локальных файлов или скриншотов:

Уровень детализации изображения#

Точность анализа управляется параметром `detail`:

Значение

Описание

Сценарий применения

`auto`

Автоматический выбор (по умолчанию)

Общие сценарии

`low`

Низкая точность, быстрее

Простая классификация, распознавание меток

`high`

Высокая точность, детальнее

OCR документов, детальный анализ

Код
{
    "type": "image_url",
    "image_url": {
        "url": "https://example.com/document.jpg",
        "detail": "high"  # Режим высокой точности
    }
}

Сравнение нескольких изображений#

В одном запросе можно отправить несколько изображений:

Код
response = client.chat.completions.create(
    model="openai/gpt-4o",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Сравни различия между этими двумя изображениями"},
            {"type": "image_url", "image_url": {"url": "https://example.com/before.jpg"}},
            {"type": "image_url", "image_url": {"url": "https://example.com/after.jpg"}}
        ]
    }]
)

Визуальный ввод по протоколу Anthropic#

Код
import anthropic
 
client = anthropic.Anthropic(
    base_url="https://as.apinoma.com/anthropic",
    api_key="<ваш APINOMA_API_KEY>"
)
 
message = client.messages.create(
    model="anthropic/claude-sonnet-4.6",
    max_tokens=1024,
    messages=[{
        "role": "user",
        "content": [
            {
                "type": "image",
                "source": {
                    "type": "base64",
                    "media_type": "image/jpeg",
                    "data": image_data
                }
            },
            {"type": "text", "text": "Опиши это изображение"}
        ]
    }]
)

Типичные сценарии использования#

  • OCR документов — извлечение текста и таблиц из изображений
  • Анализ скриншотов кода — анализ кода на скриншоте и рекомендации по исправлению
  • Ревью UI — анализ дизайна и компоновки интерфейса
  • Чтение диаграмм — анализ графиков данных и визуализаций
  • Распознавание товаров — распознавание объектов и сцен на изображениях

Последнее обновление: 23 июня 2026 г.