Comment un routeur IA choisit-il entre un petit modèle local et un modèle plus grand ?

Eva Wong est la rédactrice technique et bricoleuse résidente chez ZimaSpace. Geek depuis toujours, passionnée par les homelabs et les logiciels open source, elle se spécialise dans la traduction de concepts techniques complexes en guides accessibles et pratiques. Eva croit que l’auto-hébergement doit être amusant, pas intimidant. À travers ses tutoriels, elle donne à la communauté les moyens de démystifier les configurations matérielles, depuis la construction de leur premier NAS jusqu’à la maîtrise des conteneurs Docker.

Un routeur d’IA sélectionne généralement le plus petit modèle admissible dont les capacités prédites, la latence, la confidentialité et le niveau de risque respectent le seuil de service déclaré pour la requête.

Une commande domestique telle que la mise en forme d’un événement de calendrier peut être traitée par un petit modèle déjà chargé sur le serveur domestique, tandis qu’une longue génération de code ou une recherche ambiguë peut nécessiter un modèle local ou distant plus grand. Le routeur extrait les signaux liés à la tâche et au contexte, applique les contraintes strictes de politique, prédit les chances de réussite et le coût, puis distribue la requête ou l’escalade lorsque la confiance est insuffisante.

Les filtres de politique écartent les modèles inadmissibles avant l’évaluation

La résidence des données, les autorisations d’outils, la longueur du contexte, la modalité, le niveau d’utilisateur, la disponibilité du matériel et le délai peuvent éliminer immédiatement certains candidats. Un modèle cloud ne devrait jamais participer à la comparaison lorsque des fichiers sensibles doivent rester en local. Cette distinction reste visible lors des tests ultérieurs à domicile.

Le témoignage d’un praticien sur le routage de spécialistes locaux décrit un petit classificateur toujours chargé, qui distribue les tâches de programmation, de raisonnement et les tâches générales à des spécialistes. Cette conception montre pourquoi le routage commence par un inventaire des capacités plutôt que par un classement universel des modèles.

Les contraintes strictes doivent être déterministes et vérifiables. Laisser un classificateur probabiliste remplacer une politique de confidentialité ou d’autorisation transforme une erreur de routage en décision de sécurité. Le résultat intermédiaire doit rester vérifiable avant toute automatisation.

Un évaluateur estime la difficulté, la qualité et le coût de traitement

Le routeur peut utiliser des règles, des embeddings, un petit classificateur, des étiquettes de tâches antérieures ou des prédicteurs de qualité des réponses. Il estime si chaque modèle admissible atteindra la qualité demandée, tout en tenant compte du temps d’attente en file, du chargement à froid, de la pression sur la mémoire et du coût en tokens.

Les recherches sur le routage de modèles fondé sur la confiance examinent des stratégies de routage et de cascade qui utilisent l’incertitude et l’évaluation externe de la qualité. Ces approches optimisent la qualité et le coût attendus plutôt que de supposer que la longueur de la requête représente à elle seule la difficulté. Cette limite doit être mesurée séparément dans des conditions d’exploitation réalistes.

La décision peut être prise au niveau de la requête ou de la sous-tâche. La réécriture d’une requête de recherche peut rester confiée à un petit modèle tandis que la synthèse finale est escaladée, à condition que le flux de travail préserve la provenance et n’expose pas de contexte restreint. La conséquence pratique apparaît lorsque plusieurs sources se disputent un contexte limité.

Le recours à un modèle de secours transforme l’incertitude en seconde chance

Un petit modèle peut produire un niveau de confiance structuré, échouer à la validation ou déclencher un vérificateur qui demande une escalade. Le routeur peut relancer la requête avec un modèle plus grand et les éléments de preuve d’origine, mais des budgets limités empêchent les cascades interminables et les actions d’outils en double.

Une explication des signaux de routage et de recours met en avant la complexité, le contexte, les métadonnées et le recours comme signaux de routage. Elle confirme que la sélection est une politique de service qui combine les capacités du modèle et les contraintes opérationnelles. Cette dépendance doit rester explicite dans l’interface finale.

La limite de défaillance est un routeur entraîné sur des tâches non représentatives ou sur des performances de modèles obsolètes. Un mauvais routage effectué avec confiance peut réduire silencieusement la qualité des réponses ; les flux de travail à enjeux importants nécessitent donc une validation déterministe ou une affectation directe, plutôt que la seule difficulté prédite.

Construisez une matrice de confusion du routage selon le coût et la qualité

Étiquetez un ensemble représentatif de requêtes avec la classe de confidentialité, la modalité, la longueur du contexte, la famille de tâches, le risque, le délai, le plus petit modèle acceptable et le résultat vérifié. Rejouez-le dans des conditions réalistes de file d’attente et de mémoire. Le résultat doit donc être comparé aux éléments de preuve d’origine.

Comparez l’architecture avec le routage de modèles locaux. Consignez le modèle choisi, le motif du routage, le coût du démarrage à froid, le TTFT, la latence de complétion, le score de qualité, le résultat de validation, l’escalade, l’utilisation des ressources et les violations de politique. Cette distinction reste visible lors des tests ultérieurs à domicile.

Définissez séparément les seuils pour les routages vers un modèle trop petit et les routages inutilement dirigés vers un modèle trop grand. Affectez les tâches à haut risque à des parcours validés, réentraînez les modèles ou révisez les règles lorsque la dérive de la charge de travail apparaît, et exposez aux utilisateurs le modèle sélectionné ainsi que l’état du recours. Le résultat intermédiaire doit rester vérifiable avant toute automatisation.

Centre Tech & IA

Plus à lire

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.