Un modelo de IA doméstico puede atender de forma fiable a entre uno y varios usuarios interactivos, pero el límite estable depende de la demanda de tokens, el procesamiento por lotes y los objetivos de latencia.
Un modelo que produce 30 tokens por segundo puede parecer rápido para un chat breve, pero ralentizarse cuando cuatro personas envían prompts largos al mismo tiempo. La concurrencia consume memoria de caché KV, comparte la capacidad de decodificación y genera picos de espera en la cola. El límite correcto es la mayor carga ofrecida que aún cumple un objetivo p95 definido de primer token y tasa de tokens durante el uso familiar normal.
La concurrencia convierte el rendimiento en tiempo de espera
Una estimación aproximada de la capacidad divide el rendimiento sostenido de generación entre el promedio de tokens solicitados por segundo en todas las sesiones activas. Cuando la demanda se acerca a la capacidad de servicio, pequeños picos crean colas largas. Los usuarios no son unidades idénticas: una respuesta de 50 tokens y otra de 2.000 ocupan el servidor de manera diferente.
Un análisis de la latencia y el rendimiento explica que el procesamiento por lotes mejora el rendimiento agregado, aunque a menudo lo hace a costa de la latencia de respuesta individual. Esa tensión determina si las sesiones adicionales se sienten estables.
El prellenado del prompt también puede bloquear el trabajo de decodificación, según el planificador. Dos usuarios que pegan documentos grandes pueden perjudicar a todos más que seis usuarios que hagan preguntas breves. Por tanto, un recuento de usuarios sin distribuciones de prompts y salidas no es extrapolable.
La caché KV y la planificación crean un segundo límite
Cada secuencia activa almacena las claves y los valores de atención de su contexto. Los historiales más largos y los lotes más grandes aumentan el uso de la caché KV hasta que las solicitudes se rechazan, se intercambian o se retrasan. El procesamiento continuo por lotes puede admitir nuevo trabajo entre iteraciones de decodificación, lo que mejora el aprovechamiento, pero no crea memoria libre.
Una explicación técnica del procesamiento continuo por lotes muestra cómo la planificación a nivel de iteración llena los espacios de lote que, de otro modo, quedarían inactivos. El beneficio depende de la carga de trabajo y puede aumentar ligeramente la contención por solicitud.
La latencia se vuelve inestable cerca de la saturación porque la longitud de la cola reacciona bruscamente a la variación en las llegadas. La latencia media puede aumentar gradualmente, mientras que la latencia p95 y la máxima se disparan. La capacidad estable debería situarse por debajo de ese punto crítico, no en el máximo de tokens por segundo del benchmark.
Cuándo el número de usuarios deja de predecir la experiencia
El mismo servidor puede admitir más usuarios para el autocompletado que para RAG, el uso de herramientas o la generación de textos largos. Los arranques en frío, la limitación térmica, la recuperación y la síntesis de voz añaden etapas externas al servicio del modelo. Una cifra de concurrencia del modelo no puede garantizar la capacidad de respuesta de toda la aplicación.
Una guía de servicio sobre la memoria de servicio describe la memoria, el contexto, el procesamiento por lotes y el paralelismo como restricciones interrelacionadas. Cambiar cualquiera de ellas puede desplazar el punto crítico de capacidad.
La predicción también falla si las solicitudes familiares llegan en picos sincronizados en lugar de hacerlo de forma independiente. Cuatro usuarios que rara vez coinciden pueden ser fáciles de atender, mientras que dos agentes automatizados pueden saturar el modelo continuamente. Mide el trabajo ofrecido, no las cuentas registradas.
Encuentra el punto crítico de concurrencia con una prueba de carga
Reproduce solicitudes realistas cortas, medianas y largas con una, dos, cuatro y ocho sesiones simultáneas. Mantén fijos el modelo, la cuantización, el límite de contexto y el muestreo. Registra el tiempo en cola, la latencia del primer token, la latencia entre tokens, la tasa de finalización, el uso de la caché KV y los valores p50, p95 y máximos.
Utiliza la arquitectura de sesiones con un modelo compartido como contexto de prueba cuando varias sesiones del hogar compartan un mismo modelo. Mantén las etapas de RAG y herramientas desactivadas o mídeles el tiempo por separado.
Declara el límite estable como la mayor concurrencia cuya latencia p95 del primer token se mantenga dentro del objetivo del hogar, sin una tendencia creciente de la cola ni errores de memoria. Conserva entre un 20 y un 30 % de margen de rendimiento para los picos. Repite la prueba cada vez que cambien la longitud del contexto, el modelo o el planificador.
Centro de Tecnología e IA
Más para leer

Cómo medir la calidad de recuperación de RAG local e interpretar la exhaustividad, la precisión y la cobertura de citas
Crea un conjunto de pruebas RAG local, calcula las métricas principales de recuperación, interpreta sus ventajas y desventajas, y audita si las afirmaciones de...

¿Por qué es cada vez más importante la computación de funciones del hogar inteligente a medida que aumenta la cantidad de sensores con la misma frecuencia de muestreo?
Rastrea el procesamiento por sensor y entre sensores a medida que aumenta el número de dispositivos, identifica los costos no lineales de la fusión...

¿Por qué importa más el costo de evaluar RAG a medida que crece la biblioteca de documentos con el mismo volumen de consultas?
Comprende por qué el crecimiento del corpus aumenta el esfuerzo de evaluación de RAG sin más consultas de los usuarios y cómo las pruebas...

