Fallback

Mekanisme Fallback 诺玛AI secara otomatis beralih ke model cadangan saat model utama tidak tersedia, memastikan layanan Anda tidak terputus.

Cara Kerja#

  • Permintaan dikirim ke model utama
  • Jika model utama mengembalikan error (5xx, timeout, rate limit, dll.)
  • Secara otomatis mencoba model dalam daftar fallback secara berurutan
  • Mengembalikan respons sukses pertama

Fallback Per Permintaan#

Konfigurasikan fallback untuk satu permintaan melalui parameter `provider.fallback`:

Kode
from openai import OpenAI
 
client = OpenAI(
    base_url="https://as.apinoma.com/v1",
    api_key="<APINOMA_API_KEY_Anda>"
)

response = client.chat.completions.create(
    model="openai/gpt-4o",  # Model utama
    messages=[{"role": "user", "content": "Halo"}],
    extra_body={
        "provider": {
            "fallback": [
                "anthropic/claude-sonnet-4.6",  # Cadangan pertama
                "google/gemini-pro-compatible-flash-lite-preview"              # Cadangan kedua
            ]
        }
    }
)

# Lihat model yang sebenarnya digunakan
print(response.model)

Kondisi Pemicu Fallback#

Kondisi berikut akan memicu fallback:

Kondisi

Keterangan

HTTP 5xx

Error server

Permintaan timeout

Respons model timeout

429 rate limit

Model upstream mencapai batas laju

Model tidak tersedia

Penyedia sedang dalam pemeliharaan atau offline

Kondisi berikut tidak akan memicu fallback:

Kondisi

Keterangan

HTTP 4xx (selain 429)

Error klien yang memerlukan perbaikan permintaan

Penyaringan konten

Konten yang ditolak untuk dibuat oleh model

Digunakan Bersama Perutean#

Mekanisme fallback dapat dikombinasikan dengan Perutean Penyedia:

Kode
response = client.chat.completions.create(
    model="openai/gpt-4o",
    messages=[{"role": "user", "content": "Halo"}],
    extra_body={
        "provider": {
            "routing": "latency",    # Perutean prioritas latensi
            "fallback": [             # Daftar fallback
                "anthropic/claude-sonnet-4.6",
                "google/gemini-pro-compatible-flash-lite-preview"
            ]
        }
    }
)

Rekomendasi Skema Fallback#

Untuk model yang direkomendasikan, lihat Galeri Model.

Praktik Terbaik#

  • Pilih model cadangan dengan kemampuan setara — memastikan kualitas output tetap konsisten setelah fallback
  • Fallback lintas penyedia — menghindari model dari penyedia yang sama tidak tersedia secara bersamaan
  • Atur 2-3 cadangan — cukup untuk menangani sebagian besar skenario kegagalan
  • Pantau frekuensi fallback — jika sering terjadi fallback, mungkin Anda perlu mengganti model utama

Terakhir diperbarui pada 23 Juni 2026