Routage des fournisseurs
诺玛AI prend en charge une architecture multi-fournisseurs, permettant à un même modèle d'être servi via différents nœuds fournisseurs. Les stratégies de routage vous permettent de contrôler la distribution des requêtes.
Stratégies de routage#
Stratégie
Description
Cas d'usage
`priority`
Par ordre de priorité (par défaut)
Priorité à la stabilité
`cost`
Coût le plus bas en priorité
Traitement par lots, sensible aux coûts
`latency`
Latence la plus faible en priorité
Conversation en temps réel, interaction utilisateur
`balanced`
Équilibrage de charge
Scénarios à forte concurrence
Mode d'utilisation#
Configurez la stratégie de routage via le paramètre étendu `provider.routing` :
from openai import OpenAI
client = OpenAI(
base_url="https://as.apinoma.com/v1",
api_key="<votre APINOMA_API_KEY>"
)
response = client.chat.completions.create(
model="openai/gpt-4o",
messages=[{"role": "user", "content": "Bonjour"}],
extra_body={
"provider": {
"routing": "cost" # Coût le plus bas en priorité
}
}
)Détail des stratégies#
`priority` — Routage par priorité (par défaut)
Les requêtes sont distribuées selon l'ordre de priorité des fournisseurs prédéfini par 诺玛AI. Le nœud le plus stable est utilisé en priorité.
`cost` — Priorité au coût
Sélectionne automatiquement le nœud fournisseur au coût le plus bas. Idéal pour le traitement par lots, l'annotation de données et autres scénarios peu sensibles à la latence.
`latency` — Priorité à la latence
Sélectionne le nœud fournisseur avec la latence de réponse la plus faible. Idéal pour les scénarios de conversation en temps réel nécessitant une réponse rapide.
`balanced` — Équilibrage de charge
Répartit les requêtes uniformément entre tous les nœuds fournisseurs disponibles. Idéal pour les scénarios à forte concurrence, évitant la surcharge d'un point unique.
Bonnes pratiques#
- Utilisez `latency` pour les conversations en temps réel — réduit le temps d'attente des utilisateurs
- Utilisez `cost` pour les tâches par lots — réduit le coût global
- Utilisez `priority` par défaut en production — garantit la stabilité
- Combinez avec le repli automatique — la stratégie de routage peut être utilisée conjointement avec le paramètre `fallback`
Vous pouvez également définir la stratégie de routage par défaut globale dans la console 诺玛AI, sans avoir à la spécifier à chaque requête.
Dernière mise à jour le 23 juin 2026