視覺理解
诺玛AI 支援多模態模型的視覺輸入,可以分析影像、截圖、
支援的模型#
模型
影像
影片
說明
`openai/gpt-4o`
✅
—
高質量影像分析
`openai/gpt-4o-mini`
✅
—
快速影像分析
`anthropic/claude-sonnet-4.6`
✅
—
強大的文件和程式碼理解
`google/gemini-pro-compatible-flash-lite-preview`
✅
✅
多模態全能
`google/gemini-pro-compatible-pro-preview`
✅
✅
最強多模態推理
影像分析#
透過 URL 傳送影像
cURL
程式碼
curl https://as.apinoma.com/v1/chat/completions \
-H "Authorization: Bearer $APINOMA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-4o",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "描述這張圖片的內容"},
{"type": "image_url", "image_url": {"url": "https://example.com/photo.jpg"}}
]
}]
}'Python
TypeScript
透過 Base64 傳送影像
適用於本地檔案或截圖場景:
影像細節級別#
透過 `detail` 引數控制分析精度:
值
說明
適用場景
`auto`
自動選擇(預設)
一般場景
`low`
低精度,更快速
簡單分類、標籤識別
`high`
高精度,更詳細
文件 OCR、細節分析
程式碼
{
"type": "image_url",
"image_url": {
"url": "https://example.com/document.jpg",
"detail": "high" # 高精度模式
}
}多圖對比#
可以在一個請求中傳送多張圖片:
程式碼
response = client.chat.completions.create(
model="openai/gpt-4o",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "比較這兩張圖片的區別"},
{"type": "image_url", "image_url": {"url": "https://example.com/before.jpg"}},
{"type": "image_url", "image_url": {"url": "https://example.com/after.jpg"}}
]
}]
)Anthropic 協議的視覺輸入#
程式碼
import anthropic
client = anthropic.Anthropic(
base_url="https://as.apinoma.com/anthropic",
api_key="<你的 APINOMA_API_KEY>"
)
message = client.messages.create(
model="anthropic/claude-sonnet-4.6",
max_tokens=1024,
messages=[{
"role": "user",
"content": [
{
"type": "image",
"source": {
"type": "base64",
"media_type": "image/jpeg",
"data": image_data
}
},
{"type": "text", "text": "描述這張圖片"}
]
}]
)常見用例#
- 表格
- 程式碼截圖分析 — 分析截圖中的程式碼並提供修改建議
- UI 審查 — 分析介面設計和佈局
- 圖表解讀 — 分析資料圖表和視覺化內容
- 產品識別 — 識別圖片中的物體和場景
最後更新於 2026 年 6 月 23 日