Fallback
Mekanisme Fallback 诺玛AI secara otomatis beralih ke model cadangan saat model utama tidak tersedia, memastikan layanan Anda tidak terputus.
Cara Kerja#
- Permintaan dikirim ke model utama
- Jika model utama mengembalikan error (5xx, timeout, rate limit, dll.)
- Secara otomatis mencoba model dalam daftar fallback secara berurutan
- Mengembalikan respons sukses pertama
Fallback Per Permintaan#
Konfigurasikan fallback untuk satu permintaan melalui parameter `provider.fallback`:
from openai import OpenAI
client = OpenAI(
base_url="https://as.apinoma.com/v1",
api_key="<APINOMA_API_KEY_Anda>"
)
response = client.chat.completions.create(
model="openai/gpt-4o", # Model utama
messages=[{"role": "user", "content": "Halo"}],
extra_body={
"provider": {
"fallback": [
"anthropic/claude-sonnet-4.6", # Cadangan pertama
"google/gemini-pro-compatible-flash-lite-preview" # Cadangan kedua
]
}
}
)
# Lihat model yang sebenarnya digunakan
print(response.model)Kondisi Pemicu Fallback#
Kondisi berikut akan memicu fallback:
Kondisi
Keterangan
HTTP 5xx
Error server
Permintaan timeout
Respons model timeout
429 rate limit
Model upstream mencapai batas laju
Model tidak tersedia
Penyedia sedang dalam pemeliharaan atau offline
Kondisi berikut tidak akan memicu fallback:
Kondisi
Keterangan
HTTP 4xx (selain 429)
Error klien yang memerlukan perbaikan permintaan
Penyaringan konten
Konten yang ditolak untuk dibuat oleh model
Digunakan Bersama Perutean#
Mekanisme fallback dapat dikombinasikan dengan Perutean Penyedia:
response = client.chat.completions.create(
model="openai/gpt-4o",
messages=[{"role": "user", "content": "Halo"}],
extra_body={
"provider": {
"routing": "latency", # Perutean prioritas latensi
"fallback": [ # Daftar fallback
"anthropic/claude-sonnet-4.6",
"google/gemini-pro-compatible-flash-lite-preview"
]
}
}
)Rekomendasi Skema Fallback#
Untuk model yang direkomendasikan, lihat Galeri Model.
Praktik Terbaik#
- Pilih model cadangan dengan kemampuan setara — memastikan kualitas output tetap konsisten setelah fallback
- Fallback lintas penyedia — menghindari model dari penyedia yang sama tidak tersedia secara bersamaan
- Atur 2-3 cadangan — cukup untuk menangani sebagian besar skenario kegagalan
- Pantau frekuensi fallback — jika sering terjadi fallback, mungkin Anda perlu mengganti model utama
Terakhir diperbarui pada 23 Juni 2026