Un enrutador de IA suele seleccionar el modelo elegible más pequeño cuyas capacidades previstas, latencia, privacidad y riesgo cumplen el umbral de servicio declarado para la solicitud.
Un comando doméstico, como dar formato a un evento del calendario, puede adaptarse a un modelo pequeño ya cargado en el servidor doméstico, mientras que una síntesis de código extensa o una investigación ambigua pueden requerir un modelo local o remoto más grande. El enrutador extrae señales de la tarea y el contexto, aplica restricciones de política estrictas, predice la probabilidad de éxito y el coste, y después asigna la solicitud o la escala cuando la confianza no alcanza el nivel necesario.
Las puertas de política eliminan los modelos no elegibles antes de la puntuación
La residencia de los datos, los permisos de las herramientas, la longitud del contexto, la modalidad, el nivel del usuario, la disponibilidad del hardware y el plazo pueden descartar candidatos de inmediato. Un modelo en la nube nunca debería entrar en la competencia de puntuación cuando los archivos sensibles deben permanecer localmente. Esta distinción sigue siendo visible durante las pruebas domésticas posteriores.
Un relato práctico sobre el enrutamiento de especialistas locales describe un clasificador pequeño siempre cargado que asigna el código, el razonamiento y las tareas generales a especialistas. El diseño ilustra por qué el enrutamiento comienza con un inventario de capacidades, en lugar de una clasificación universal de modelos.
Las restricciones estrictas deben ser deterministas y fáciles de inspeccionar. Permitir que un clasificador probabilístico anule la política de privacidad o permisos convierte un error de enrutamiento en una decisión de seguridad. El resultado intermedio debe seguir siendo inspeccionable antes de que la automatización continúe.
Un puntuador estima la dificultad, la calidad y el coste de servicio
El enrutador puede utilizar reglas, embeddings, un clasificador pequeño, etiquetas de tareas anteriores o predictores de calidad de respuesta. Estima si cada modelo elegible alcanzará la calidad solicitada, teniendo en cuenta el tiempo de espera en cola, la carga en frío, la presión de memoria y el coste de los tokens.
La investigación sobre el enrutamiento de modelos basado en la confianza analiza estrategias de enrutamiento y cascada que utilizan la incertidumbre y la evaluación externa de la calidad. Estos enfoques optimizan la calidad y el coste esperados, en lugar de asumir que la longitud de la consulta representa por sí sola la dificultad. Ese límite debe medirse por separado en condiciones operativas realistas.
La decisión puede tomarse a nivel de solicitud o de subtarea. La reescritura de una consulta de recuperación puede mantenerse en un modelo pequeño mientras la síntesis final escala a otro mayor, siempre que el flujo de trabajo conserve la procedencia y no exponga contexto restringido. La consecuencia práctica aparece cuando varias fuentes compiten por un contexto limitado.
El fallback convierte la incertidumbre en una segunda oportunidad
Un modelo pequeño puede producir una confianza estructurada, no superar la validación o activar un verificador que solicite una escala. El enrutador puede volver a intentar la operación con el modelo más grande y las pruebas originales, pero unos presupuestos limitados evitan cascadas interminables y acciones duplicadas de las herramientas.
Una explicación del enrutamiento y las señales de fallback destaca la complejidad, el contexto, los metadatos y el fallback como señales de enrutamiento. Refuerza la idea de que la selección es una política de servicio que combina la capacidad del modelo con las restricciones operativas. Esta dependencia debe seguir siendo explícita en la interfaz final.
El límite de fallo es un enrutador entrenado con tareas no representativas o con un rendimiento de modelos obsoleto. Un enrutamiento erróneo realizado con confianza puede reducir silenciosamente la calidad de las respuestas, por lo que los flujos de trabajo con consecuencias importantes necesitan una validación determinista o una asignación directa, en lugar de basarse únicamente en la dificultad prevista.
Construye una matriz de confusión del enrutamiento coste-calidad
Etiqueta un conjunto representativo de solicitudes con la clase de privacidad, la modalidad, la longitud del contexto, la familia de tareas, el riesgo, el plazo, el modelo más pequeño aceptable y el resultado verificado. Reprodúcelo en condiciones realistas de cola y memoria. Por tanto, el resultado debe comprobarse con las pruebas originales.
Compara la arquitectura con el enrutamiento de modelos locales. Registra el modelo elegido, el motivo de la ruta, el coste de arranque en frío, el TTFT, la latencia de finalización, la puntuación de calidad, el resultado de la validación, la escala, el uso de recursos y las infracciones de la política. Esta distinción sigue siendo visible durante las pruebas domésticas posteriores.
Establece umbrales por separado para las rutas que eligen un modelo demasiado pequeño y las que eligen innecesariamente uno demasiado grande. Asigna las tareas de alto riesgo a rutas validadas, vuelve a entrenar o revisa las reglas cuando aparezca una desviación de la carga de trabajo y muestra a los usuarios el modelo seleccionado y el estado del fallback. El resultado intermedio debe seguir siendo inspeccionable antes de que la automatización continúe.
Centro de Tecnología e IA
Más para leer

¿Cómo afecta la reducción de resolución de series temporales a la detección de anomalías en hogares inteligentes?
Descubre cómo el ancho de los intervalos, la agregación, el antialiasing, los datos faltantes, la duración de los eventos y la retención multiescala cambian...

¿Cómo combina una cuadrícula de ocupación las señales débiles del hogar inteligente?
Aprende cómo las celdas espaciales, los modelos de sensores, las actualizaciones de log-odds, la atenuación, la evidencia correlacionada y los umbrales convierten señales débiles...

¿Cómo afecta la normalización fotométrica a la agrupación privada de rostros?
Descubre cómo la corrección de la iluminación cambia los recortes faciales, los embeddings, las distancias entre clústeres, los umbrales, la sobrenormalización y la evaluación...

