Pemahaman Visual
诺玛AI mendukung input visual model multimodal, dapat menganalisis gambar, tangkapan layar, dokumen, dan konten video.
Model yang Didukung#
Model
Gambar
Video
Deskripsi
`openai/gpt-4o`
✅
—
Analisis gambar berkualitas tinggi
`openai/gpt-4o-mini`
✅
—
Analisis gambar cepat
`anthropic/claude-sonnet-4.6`
✅
—
Pemahaman dokumen dan kode yang kuat
`google/gemini-pro-compatible-flash-lite-preview`
✅
✅
Serba bisa multimodal
`google/gemini-pro-compatible-pro-preview`
✅
✅
Penalaran multimodal terkuat
Analisis Gambar#
Mengirim Gambar melalui URL
cURL
curl https://as.apinoma.com/v1/chat/completions \
-H "Authorization: Bearer $APINOMA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-4o",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Deskripsikan isi gambar ini"},
{"type": "image_url", "image_url": {"url": "https://example.com/photo.jpg"}}
]
}]
}'Python
TypeScript
Mengirim Gambar melalui Base64
Cocok untuk file lokal atau skenario tangkapan layar:
Tingkat Detail Gambar#
Kendalikan presisi analisis melalui parameter `detail`:
Nilai
Deskripsi
Kasus Penggunaan
`auto`
Pilih otomatis (default)
Skenario umum
`low`
Presisi rendah, lebih cepat
Klasifikasi sederhana, pengenalan label
`high`
Presisi tinggi, lebih detail
OCR dokumen, analisis detail
{
"type": "image_url",
"image_url": {
"url": "https://example.com/document.jpg",
"detail": "high" # mode presisi tinggi
}
}Perbandingan Beberapa Gambar#
Anda dapat mengirim beberapa gambar dalam satu permintaan:
response = client.chat.completions.create(
model="openai/gpt-4o",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Bandingkan perbedaan kedua gambar ini"},
{"type": "image_url", "image_url": {"url": "https://example.com/before.jpg"}},
{"type": "image_url", "image_url": {"url": "https://example.com/after.jpg"}}
]
}]
)Input Visual Protokol Anthropic#
import anthropic
client = anthropic.Anthropic(
base_url="https://as.apinoma.com/anthropic",
api_key="<APINOMA_API_KEY Anda>"
)
message = client.messages.create(
model="anthropic/claude-sonnet-4.6",
max_tokens=1024,
messages=[{
"role": "user",
"content": [
{
"type": "image",
"source": {
"type": "base64",
"media_type": "image/jpeg",
"data": image_data
}
},
{"type": "text", "text": "Deskripsikan gambar ini"}
]
}]
)Kasus Penggunaan Umum#
- OCR dokumen — mengekstrak teks dan tabel dari gambar
- Analisis tangkapan layar kode — menganalisis kode dalam tangkapan layar dan memberikan saran perbaikan
- Tinjauan UI — menganalisis desain antarmuka dan tata letak
- Interpretasi grafik — menganalisis grafik data dan konten visualisasi
- Identifikasi produk — mengenali objek dan pemandangan dalam gambar
Terakhir diperbarui pada 23 Juni 2026