Repli automatique (Fallback)
Le mécanisme de repli automatique de 诺玛AI bascule vers un modèle de secours lorsque le modèle principal est indisponible, garantissant la continuité de votre service.
Fonctionnement#
- La requête est envoyée au modèle principal
- Si le modèle principal retourne une erreur (5xx, timeout, limitation de débit, etc.)
- Le système tente automatiquement les modèles de la liste fallback dans l'ordre
- Retourne la première réponse réussie
Repli par requête individuelle#
Configurez le repli pour une requête individuelle via le paramètre `provider.fallback` :
from openai import OpenAI
client = OpenAI(
base_url="https://as.apinoma.com/v1",
api_key="<你的 APINOMA_API_KEY>"
)
response = client.chat.completions.create(
model="openai/gpt-4o", # modèle principal
messages=[{"role": "user", "content": "Bonjour"}],
extra_body={
"provider": {
"fallback": [
"anthropic/claude-sonnet-4.6", # premier de secours
"google/gemini-pro-compatible-flash-lite-preview" # deuxième de secours
]
}
}
)
# Voir le modèle réellement utilisé
print(response.model)Conditions de déclenchement du repli#
Les situations suivantes déclenchent le repli :
Condition
Description
HTTP 5xx
Erreur serveur
Délai d'attente dépassé
Délai de réponse du modèle dépassé
429 Limite de débit
Limite de débit atteinte en amont
Modèle indisponible
Maintenance ou mise hors ligne du fournisseur
Les situations suivantes ne déclenchent PAS le repli :
Condition
Description
HTTP 4xx(非 429)
Erreur client nécessitant une correction de la requête
Filtrage de contenu
Contenu refusé par le modèle
Combinaison avec le routage#
Le mécanisme de repli peut être combiné avec le routage de fournisseurs :
response = client.chat.completions.create(
model="openai/gpt-4o",
messages=[{"role": "user", "content": "Bonjour"}],
extra_body={
"provider": {
"routing": "latency", # Routage priorité latence
"fallback": [ # Liste de repli
"anthropic/claude-sonnet-4.6",
"google/gemini-pro-compatible-flash-lite-preview"
]
}
}
)Modèles de repli recommandés#
Consultez le catalogue de modèles pour les modèles recommandés.
Bonnes pratiques#
- Choisir des modèles de secours aux capacités similaires — garantir une qualité de sortie cohérente après repli
- Repli inter-fournisseurs — éviter que les modèles du même fournisseur soient simultanément indisponibles
- Définir 2-3 modèles de secours — suffisant pour la plupart des scénarios de panne
- Surveiller la fréquence de repli — si le repli est fréquent, envisager de changer le modèle principal
Dernière mise à jour le 23 juin 2026