Hiểu hình ảnh
诺玛AI hỗ trợ đầu vào hình ảnh cho các mô hình đa phương thức, có thể phân tích hình ảnh, ảnh chụp màn hình, tài liệu và nội dung video.
Các mô hình được hỗ trợ#
Mô hình
Hình ảnh
Video
Mô tả
`openai/gpt-4o`
✅
—
Phân tích hình ảnh chất lượng cao
`openai/gpt-4o-mini`
✅
—
Phân tích hình ảnh nhanh
`anthropic/claude-sonnet-4.6`
✅
—
Hiểu tài liệu và mã nguồn mạnh mẽ
`google/gemini-pro-compatible-flash-lite-preview`
✅
✅
Đa phương thức toàn diện
`google/gemini-pro-compatible-pro-preview`
✅
✅
Suy luận đa phương thức mạnh nhất
Phân tích hình ảnh#
Gửi hình ảnh qua URL
cURL
curl https://as.apinoma.com/v1/chat/completions \
-H "Authorization: Bearer $APINOMA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-4o",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Mô tả nội dung của bức ảnh này"},
{"type": "image_url", "image_url": {"url": "https://example.com/photo.jpg"}}
]
}]
}'Python
TypeScript
Gửi hình ảnh qua Base64
Phù hợp cho các trường hợp tập tin cục bộ hoặc ảnh chụp màn hình:
Mức độ chi tiết hình ảnh#
Kiểm soát độ chính xác phân tích thông qua tham số `detail`:
Giá trị
Mô tả
Trường hợp áp dụng
`auto`
Tự động chọn (mặc định)
Trường hợp thông thường
`low`
Độ chính xác thấp, nhanh hơn
Phân loại đơn giản, nhận diện nhãn
`high`
Độ chính xác cao, chi tiết hơn
OCR tài liệu, phân tích chi tiết
{
"type": "image_url",
"image_url": {
"url": "https://example.com/document.jpg",
"detail": "high" # Chế độ độ chính xác cao
}
}So sánh nhiều hình ảnh#
Có thể gửi nhiều hình ảnh trong một yêu cầu:
response = client.chat.completions.create(
model="openai/gpt-4o",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "So sánh sự khác biệt giữa hai bức ảnh này"},
{"type": "image_url", "image_url": {"url": "https://example.com/before.jpg"}},
{"type": "image_url", "image_url": {"url": "https://example.com/after.jpg"}}
]
}]
)Đầu vào hình ảnh của giao thức Anthropic#
import anthropic
client = anthropic.Anthropic(
base_url="https://as.apinoma.com/anthropic",
api_key="<APINOMA_API_KEY của bạn>"
)
message = client.messages.create(
model="anthropic/claude-sonnet-4.6",
max_tokens=1024,
messages=[{
"role": "user",
"content": [
{
"type": "image",
"source": {
"type": "base64",
"media_type": "image/jpeg",
"data": image_data
}
},
{"type": "text", "text": "Mô tả bức ảnh này"}
]
}]
)Các trường hợp sử dụng phổ biến#
- OCR tài liệu — Trích xuất văn bản và bảng biểu trong hình ảnh
- Phân tích ảnh chụp mã nguồn — Phân tích mã trong ảnh chụp màn hình và đưa ra đề xuất chỉnh sửa
- Đánh giá UI — Phân tích thiết kế và bố cục giao diện
- Diễn giải biểu đồ — Phân tích biểu đồ dữ liệu và nội dung trực quan hóa
- Nhận diện sản phẩm — Nhận diện vật thể và khung cảnh trong hình ảnh
Cập nhật lần cuối vào 23 tháng 6, 2026