Compréhension visuelle

诺玛AI prend en charge l'entrée visuelle des modèles multimodaux, capable d'analyser des images, des captures d'écran, des documents et du contenu vidéo.

Modèles pris en charge#

Modèle

Image

Vidéo

Description

`openai/gpt-4o`

Analyse d'image de haute qualité

`openai/gpt-4o-mini`

Analyse d'image rapide

`anthropic/claude-sonnet-4.6`

Compréhension puissante des documents et du code

`google/gemini-pro-compatible-flash-lite-preview`

Polyvalence multimodale

`google/gemini-pro-compatible-pro-preview`

Raisonnement multimodal le plus puissant

Analyse d'images#

Envoyer une image via URL

cURL

Code
curl https://as.apinoma.com/v1/chat/completions \
  -H "Authorization: Bearer $APINOMA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-4o",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Décris le contenu de cette image"},
        {"type": "image_url", "image_url": {"url": "https://example.com/photo.jpg"}}
      ]
    }]
  }'

Python

TypeScript

Envoyer une image via Base64

Adapté aux fichiers locaux ou aux captures d'écran :

Niveau de détail de l'image#

Contrôlez la précision de l'analyse via le paramètre `detail` :

Valeur

Description

Cas d'usage

`auto`

Sélection automatique (par défaut)

Cas général

`low`

Précision faible, plus rapide

Classification simple, reconnaissance d'étiquettes

`high`

Haute précision, plus détaillé

OCR de documents, analyse détaillée

Code
{
    "type": "image_url",
    "image_url": {
        "url": "https://example.com/document.jpg",
        "detail": "high"  # Mode haute précision
    }
}

Comparaison de plusieurs images#

Vous pouvez envoyer plusieurs images dans une seule requête :

Code
response = client.chat.completions.create(
    model="openai/gpt-4o",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Compare les différences entre ces deux images"},
            {"type": "image_url", "image_url": {"url": "https://example.com/before.jpg"}},
            {"type": "image_url", "image_url": {"url": "https://example.com/after.jpg"}}
        ]
    }]
)

Entrée visuelle au protocole Anthropic#

Code
import anthropic
 
client = anthropic.Anthropic(
    base_url="https://as.apinoma.com/anthropic",
    api_key="<votre APINOMA_API_KEY>"
)
 
message = client.messages.create(
    model="anthropic/claude-sonnet-4.6",
    max_tokens=1024,
    messages=[{
        "role": "user",
        "content": [
            {
                "type": "image",
                "source": {
                    "type": "base64",
                    "media_type": "image/jpeg",
                    "data": image_data
                }
            },
            {"type": "text", "text": "Décris cette image"}
        ]
    }]
)

Cas d'usage courants#

  • OCR de documents — extraire le texte et les tableaux des images
  • Analyse de captures de code — analyser le code dans une capture d'écran et proposer des modifications
  • Revue d'UI — analyser la conception et la mise en page de l'interface
  • Lecture de graphiques — analyser les graphiques de données et les visualisations
  • Reconnaissance de produits — identifier les objets et scènes dans une image

Dernière mise à jour le 23 juin 2026