الفهم البصري
تدعم 诺玛AI الإدخال البصري للنماذج متعدّدة الوسائط، إذ يمكنها تحليل محتوى الصور ولقطات الشاشة والمستندات والفيديو.
النماذج المدعومة#
النموذج
الصورة
الفيديو
الوصف
`openai/gpt-4o`
✅
—
تحليل صور عالي الجودة
`openai/gpt-4o-mini`
✅
—
تحليل صور سريع
`anthropic/claude-sonnet-4.6`
✅
—
فهم قوي للمستندات والشيفرة
`google/gemini-pro-compatible-flash-lite-preview`
✅
✅
متعدّد الوسائط شامل
`google/gemini-pro-compatible-pro-preview`
✅
✅
أقوى استدلال متعدّد الوسائط
تحليل الصور#
إرسال صورة عبر URL
cURL
curl https://as.apinoma.com/v1/chat/completions \
-H "Authorization: Bearer $APINOMA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-4o",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "صِف محتوى هذه الصورة"},
{"type": "image_url", "image_url": {"url": "https://example.com/photo.jpg"}}
]
}]
}'Python
TypeScript
إرسال صورة عبر Base64
مناسب للملفات المحلية أو سيناريوهات لقطات الشاشة:
مستوى تفاصيل الصورة#
تحكّم في دقة التحليل عبر معامل `detail`:
القيمة
الوصف
سيناريو الاستخدام
`auto`
اختيار تلقائي (افتراضي)
سيناريو عام
`low`
دقة منخفضة، أسرع
تصنيف بسيط، التعرّف على العلامات
`high`
دقة عالية، أكثر تفصيلاً
OCR للمستندات، تحليل التفاصيل
{
"type": "image_url",
"image_url": {
"url": "https://example.com/document.jpg",
"detail": "high" # وضع الدقة العالية
}
}مقارنة عدّة صور#
يمكن إرسال عدّة صور في طلب واحد:
response = client.chat.completions.create(
model="openai/gpt-4o",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "قارن الفرق بين هاتين الصورتين"},
{"type": "image_url", "image_url": {"url": "https://example.com/before.jpg"}},
{"type": "image_url", "image_url": {"url": "https://example.com/after.jpg"}}
]
}]
)الإدخال البصري عبر بروتوكول Anthropic#
import anthropic
client = anthropic.Anthropic(
base_url="https://as.apinoma.com/anthropic",
api_key="<مفتاح APINOMA_API_KEY الخاص بك>"
)
message = client.messages.create(
model="anthropic/claude-sonnet-4.6",
max_tokens=1024,
messages=[{
"role": "user",
"content": [
{
"type": "image",
"source": {
"type": "base64",
"media_type": "image/jpeg",
"data": image_data
}
},
{"type": "text", "text": "صِف هذه الصورة"}
]
}]
)حالات استخدام شائعة#
- OCR للمستندات — استخراج النصوص والجداول من الصور
- تحليل لقطات شيفرة — تحليل الشيفرة في لقطات الشاشة وتقديم اقتراحات للتعديل
- مراجعة واجهة المستخدم — تحليل تصميم الواجهة وتخطيطها
- تفسير المخططات — تحليل مخططات البيانات والمحتوى المرئي
- التعرّف على المنتجات — التعرّف على الأشياء والمشاهد في الصور
آخر تحديث في 23 يونيو 2026