¿Por qué la sobrecarga de las herramientas de los agentes importa más a medida que aumentan los pasos del flujo de trabajo con el mismo tamaño de modelo?

Eva Wong es la Redactora técnica y manitas residente en ZimaSpace. Una geek de toda la vida con pasión por los homelabs y el software de código abierto, se especializa en traducir conceptos técnicos complejos en guías accesibles y prácticas. Eva cree que el autoalojamiento debe ser divertido, no intimidante. A través de sus tutoriales, empodera a la comunidad para desmitificar las configuraciones de hardware, desde construir su primer NAS hasta dominar los contenedores Docker.

La sobrecarga de los agentes aumenta con la longitud del flujo de trabajo porque cada paso añade espera de herramientas, contexto, validación, transferencia de estado y otra oportunidad de reintento.

Un modelo local de 7B puede responder rápidamente a una solicitud directa, pero tardar mucho más cuando debe buscar, analizar, calcular, escribir y verificar en secuencia. Los pesos del modelo permanecen sin cambios. El flujo de trabajo añade dependencias seriales y devuelve cada resultado a las indicaciones posteriores, lo que aumenta tanto el tiempo transcurrido como los tokens procesados durante una ejecución exitosa completa.

Las esperas seriales de las herramientas se acumulan aunque la inferencia sea constante

En un flujo de trabajo estrictamente dependiente, la latencia total se aproxima a la suma de los turnos del modelo, las llamadas a herramientas, la serialización y las esperas en cola. Cinco herramientas de 400 milisegundos añaden dos segundos antes del razonamiento adicional. Un valor atípico lento puede dominar toda la ruta.

Un estudio de 2026 sobre el uso de herramientas por parte de los agentes describe una acumulación lineal o peor de la latencia cuando la inferencia posterior espera los resultados de herramientas anteriores. El paralelismo solo ayuda cuando las dependencias son realmente independientes.

Cada límite también convierte argumentos y resultados, comprueba esquemas y puede atravesar un proceso o una red. El tamaño del modelo explica el coste de inferencia por turno, pero no la cantidad ni la duración de los límites de orquestación.

Los datos devueltos amplían los turnos posteriores del modelo

Las salidas de las herramientas suelen añadirse al contexto. Los pasos posteriores vuelven a leer observaciones, planes y errores anteriores, por lo que el procesamiento de tokens puede crecer con la profundidad. Un primer resultado demasiado detallado penaliza cada turno posterior, a menos que se filtre o resuma de forma segura.

Un análisis del coste de ejecución de los agentes informa de que la planificación, la ejecución, la verificación y las transferencias pueden consumir varias veces más tokens que una respuesta directa. La fracción desperdiciada es una propiedad de la ejecución, no de la inteligencia del modelo.

La validación añade una sobrecarga útil al prevenir acciones inseguras, pero las comprobaciones redundantes pueden crear bucles. Almacenar en caché los resultados de solo lectura ayuda únicamente cuando se conservan la actualidad y el ámbito del usuario. Los modelos más rápidos no pueden eliminar un grafo de dependencias innecesario.

Cuándo más pasos no implican proporcionalmente más coste

Las llamadas independientes a herramientas pueden ejecutarse de forma simultánea, las transformaciones deterministas pueden omitir el modelo y los resultados almacenados en caché pueden eliminar trabajo repetido. Un grafo de diez pasos con ramas paralelas amplias puede terminar más rápido que una cadena serial de tres pasos.

Un análisis de producción sobre la sobrecarga de las llamadas a herramientas muestra cómo una mala selección de llamadas y las invocaciones innecesarias aumentan tanto la latencia como el uso de tokens. La calidad de los pasos importa tanto como su cantidad.

Este mecanismo también deja de aplicarse cuando el tiempo de las herramientas es insignificante frente a una única inferencia o carga dominante. En ese caso, contar solo los pasos resulta engañoso. Más pasos no son automáticamente perjudiciales si generan mejoras observables de seguridad o corrección que justifican su coste.

Rastrea el coste de ejecución en todo el grafo del agente

Rastrea cada flujo de trabajo con marcas de tiempo para el prellenado del modelo, la generación, la validación de argumentos, la cola de herramientas, la ejecución, la serialización de resultados, la verificación y los reintentos. Registra los tokens de entrada y salida en cada turno. Compara el grafo completo con una referencia de respuesta directa en las mismas tareas.

Utiliza la verificación de resultados de herramientas como un paso medido independiente, en lugar de ocultar la verificación dentro del “tiempo del agente”. Clasifica las dependencias como seriales, seguras para ejecutarse en paralelo o eliminables.

Optimiza primero el tramo serial repetido más grande. Recorta o estructura las salidas de las herramientas antes de volver a insertarlas, paraleliza únicamente las lecturas independientes y conserva la validación cuando el coste de los fallos sea alto. Realiza un seguimiento tanto de la tasa de finalización exitosa como de la latencia p95 para que las mejoras de velocidad no oculten una ejecución más débil.

Centro de Tecnología e IA

Más para leer

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.