Repli automatique (Fallback)

Le mécanisme de repli automatique de 诺玛AI bascule vers un modèle de secours lorsque le modèle principal est indisponible, garantissant la continuité de votre service.

Fonctionnement#

  • La requête est envoyée au modèle principal
  • Si le modèle principal retourne une erreur (5xx, timeout, limitation de débit, etc.)
  • Le système tente automatiquement les modèles de la liste fallback dans l'ordre
  • Retourne la première réponse réussie

Repli par requête individuelle#

Configurez le repli pour une requête individuelle via le paramètre `provider.fallback` :

Code
from openai import OpenAI
 
client = OpenAI(
    base_url="https://as.apinoma.com/v1",
    api_key="<你的 APINOMA_API_KEY>"
)
 
response = client.chat.completions.create(
    model="openai/gpt-4o",  # modèle principal
    messages=[{"role": "user", "content": "Bonjour"}],
    extra_body={
        "provider": {
            "fallback": [
                "anthropic/claude-sonnet-4.6",  # premier de secours
                "google/gemini-pro-compatible-flash-lite-preview"              # deuxième de secours
            ]
        }
    }
)
 
# Voir le modèle réellement utilisé
print(response.model)

Conditions de déclenchement du repli#

Les situations suivantes déclenchent le repli :

Condition

Description

HTTP 5xx

Erreur serveur

Délai d'attente dépassé

Délai de réponse du modèle dépassé

429 Limite de débit

Limite de débit atteinte en amont

Modèle indisponible

Maintenance ou mise hors ligne du fournisseur

Les situations suivantes ne déclenchent PAS le repli :

Condition

Description

HTTP 4xx(非 429)

Erreur client nécessitant une correction de la requête

Filtrage de contenu

Contenu refusé par le modèle

Combinaison avec le routage#

Le mécanisme de repli peut être combiné avec le routage de fournisseurs :

Code
response = client.chat.completions.create(
    model="openai/gpt-4o",
    messages=[{"role": "user", "content": "Bonjour"}],
    extra_body={
        "provider": {
            "routing": "latency",    # Routage priorité latence
            "fallback": [             # Liste de repli
                "anthropic/claude-sonnet-4.6",
                "google/gemini-pro-compatible-flash-lite-preview"
            ]
        }
    }
)

Modèles de repli recommandés#

Consultez le catalogue de modèles pour les modèles recommandés.

Bonnes pratiques#

  • Choisir des modèles de secours aux capacités similaires — garantir une qualité de sortie cohérente après repli
  • Repli inter-fournisseurs — éviter que les modèles du même fournisseur soient simultanément indisponibles
  • Définir 2-3 modèles de secours — suffisant pour la plupart des scénarios de panne
  • Surveiller la fréquence de repli — si le repli est fréquent, envisager de changer le modèle principal

Dernière mise à jour le 23 juin 2026