Compréhension visuelle
诺玛AI prend en charge l'entrée visuelle des modèles multimodaux, capable d'analyser des images, des captures d'écran, des documents et du contenu vidéo.
Modèles pris en charge#
Modèle
Image
Vidéo
Description
`openai/gpt-4o`
✅
—
Analyse d'image de haute qualité
`openai/gpt-4o-mini`
✅
—
Analyse d'image rapide
`anthropic/claude-sonnet-4.6`
✅
—
Compréhension puissante des documents et du code
`google/gemini-pro-compatible-flash-lite-preview`
✅
✅
Polyvalence multimodale
`google/gemini-pro-compatible-pro-preview`
✅
✅
Raisonnement multimodal le plus puissant
Analyse d'images#
Envoyer une image via URL
cURL
curl https://as.apinoma.com/v1/chat/completions \
-H "Authorization: Bearer $APINOMA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-4o",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Décris le contenu de cette image"},
{"type": "image_url", "image_url": {"url": "https://example.com/photo.jpg"}}
]
}]
}'Python
TypeScript
Envoyer une image via Base64
Adapté aux fichiers locaux ou aux captures d'écran :
Niveau de détail de l'image#
Contrôlez la précision de l'analyse via le paramètre `detail` :
Valeur
Description
Cas d'usage
`auto`
Sélection automatique (par défaut)
Cas général
`low`
Précision faible, plus rapide
Classification simple, reconnaissance d'étiquettes
`high`
Haute précision, plus détaillé
OCR de documents, analyse détaillée
{
"type": "image_url",
"image_url": {
"url": "https://example.com/document.jpg",
"detail": "high" # Mode haute précision
}
}Comparaison de plusieurs images#
Vous pouvez envoyer plusieurs images dans une seule requête :
response = client.chat.completions.create(
model="openai/gpt-4o",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Compare les différences entre ces deux images"},
{"type": "image_url", "image_url": {"url": "https://example.com/before.jpg"}},
{"type": "image_url", "image_url": {"url": "https://example.com/after.jpg"}}
]
}]
)Entrée visuelle au protocole Anthropic#
import anthropic
client = anthropic.Anthropic(
base_url="https://as.apinoma.com/anthropic",
api_key="<votre APINOMA_API_KEY>"
)
message = client.messages.create(
model="anthropic/claude-sonnet-4.6",
max_tokens=1024,
messages=[{
"role": "user",
"content": [
{
"type": "image",
"source": {
"type": "base64",
"media_type": "image/jpeg",
"data": image_data
}
},
{"type": "text", "text": "Décris cette image"}
]
}]
)Cas d'usage courants#
- OCR de documents — extraire le texte et les tableaux des images
- Analyse de captures de code — analyser le code dans une capture d'écran et proposer des modifications
- Revue d'UI — analyser la conception et la mise en page de l'interface
- Lecture de graphiques — analyser les graphiques de données et les visualisations
- Reconnaissance de produits — identifier les objets et scènes dans une image
Dernière mise à jour le 23 juin 2026