Routage des fournisseurs

诺玛AI prend en charge une architecture multi-fournisseurs, permettant à un même modèle d'être servi via différents nœuds fournisseurs. Les stratégies de routage vous permettent de contrôler la distribution des requêtes.

Stratégies de routage#

Stratégie

Description

Cas d'usage

`priority`

Par ordre de priorité (par défaut)

Priorité à la stabilité

`cost`

Coût le plus bas en priorité

Traitement par lots, sensible aux coûts

`latency`

Latence la plus faible en priorité

Conversation en temps réel, interaction utilisateur

`balanced`

Équilibrage de charge

Scénarios à forte concurrence

Mode d'utilisation#

Configurez la stratégie de routage via le paramètre étendu `provider.routing` :

Code
from openai import OpenAI
 
client = OpenAI(
    base_url="https://as.apinoma.com/v1",
    api_key="<votre APINOMA_API_KEY>"
)
 
response = client.chat.completions.create(
    model="openai/gpt-4o",
    messages=[{"role": "user", "content": "Bonjour"}],
    extra_body={
        "provider": {
            "routing": "cost"  # Coût le plus bas en priorité
        }
    }
)

Détail des stratégies#

`priority` — Routage par priorité (par défaut)

Les requêtes sont distribuées selon l'ordre de priorité des fournisseurs prédéfini par 诺玛AI. Le nœud le plus stable est utilisé en priorité.

`cost` — Priorité au coût

Sélectionne automatiquement le nœud fournisseur au coût le plus bas. Idéal pour le traitement par lots, l'annotation de données et autres scénarios peu sensibles à la latence.

`latency` — Priorité à la latence

Sélectionne le nœud fournisseur avec la latence de réponse la plus faible. Idéal pour les scénarios de conversation en temps réel nécessitant une réponse rapide.

`balanced` — Équilibrage de charge

Répartit les requêtes uniformément entre tous les nœuds fournisseurs disponibles. Idéal pour les scénarios à forte concurrence, évitant la surcharge d'un point unique.

Bonnes pratiques#

  • Utilisez `latency` pour les conversations en temps réel — réduit le temps d'attente des utilisateurs
  • Utilisez `cost` pour les tâches par lots — réduit le coût global
  • Utilisez `priority` par défaut en production — garantit la stabilité
  • Combinez avec le repli automatique — la stratégie de routage peut être utilisée conjointement avec le paramètre `fallback`

Vous pouvez également définir la stratégie de routage par défaut globale dans la console 诺玛AI, sans avoir à la spécifier à chaque requête.

Dernière mise à jour le 23 juin 2026