La gestión de la caché KV se está volviendo fundamental porque los contextos largos y las sesiones simultáneas hacen que el estado de atención en tiempo de ejecución compita directamente con los pesos del modelo.
Un modelo cuantizado puede funcionar cómodamente en una GPU doméstica hasta que se ejecutan juntas varias conversaciones largas. Su estado KV crece token a token mientras los pesos permanecen fijos. La paginación, la reutilización de prefijos, la cuantización, la descarga y la expulsión determinan ahora cuánto contexto y concurrencia puede soportar el mismo hardware sin una latencia inestable durante sesiones familiares largas y simultáneas.
Los pesos del modelo permanecen fijos mientras el estado de la sesión sigue creciendo
Durante la inferencia autorregresiva, cada token procesado produce claves y valores que utiliza la atención posterior. Los pesos se comparten, pero el estado KV crece con las capas, la longitud de la secuencia, el tamaño del lote, la concurrencia, la precisión y la arquitectura de atención. Por tanto, las conversaciones largas pueden consumir el margen restante después de cargar el modelo.
El artículo sobre PagedAttention introdujo la asignación paginada para reducir la fragmentación y compartir bloques entre solicitudes. Demostró que la eficiencia de ejecución depende de la gestión de la memoria, no solo de los pesos.
En una GPU doméstica, esta presión se manifiesta como menos sesiones simultáneas, límites de contexto más cortos, una descarga más lenta a la CPU o fallos por falta de memoria. Cuantizar los pesos puede revelar que la caché KV es la siguiente limitación, en lugar de eliminar los límites de memoria.
La gestión se ha ampliado más allá de la simple eliminación
Los entornos de ejecución modernos paginan los bloques KV, reutilizan prefijos, cuantizan los valores de la caché, descargan los bloques menos activos y expulsan tokens según un presupuesto. Cada método intercambia memoria, latencia, ancho de banda o información conservada. Ninguna política es óptima para todos los chats y modelos.
Un resumen de 2026 sobre la optimización de la caché KV enumera la paginación, la caché de prefijos, la cuantización, la expulsión y la descarga como técnicas complementarias. La pila se está volviendo estratificada porque la limitación tiene varias causas.
La expulsión recuperable es una respuesta a la poda irreversible: mantiene las ventanas probablemente útiles en menor precisión y las promociona si la atención vuelve a ellas. Esto es importante para los agentes que revisan instrucciones o pruebas antiguas después de muchos pasos con herramientas.
Dónde una caché KV más pequeña puede perjudicar la respuesta
Las ventanas deslizantes estáticas pueden descartar un nombre, una restricción o una fuente que después resulte relevante. Los errores de compresión pueden alterar la atención, mientras que la descarga puede añadir pausas de transferencia impredecibles. Reducir el uso de memoria no es automáticamente mejor si se degrada la recuperación de información o el razonamiento.
El estudio de 2026 sobre la expulsión recuperable mide la atención que vuelve a regiones antes consideradas poco importantes, lo que demuestra por qué la expulsión irreversible puede fallar durante una generación en evolución.
La limitación es menos importante para indicaciones cortas de un solo turno o arquitecturas con un estado de atención compacto. También es independiente de la memoria persistente del agente: la caché KV acelera el contexto activo, pero no sustituye un almacén duradero y editable por el usuario.
Establece el contexto y la concurrencia a partir de un presupuesto KV
Mide la VRAM reservada y asignada mientras aumentas por separado la longitud de la indicación, la longitud de salida y el número de sesiones simultáneas. Registra los bytes KV, la tasa de aciertos de la caché, la latencia del primer token, la tasa de tokens, las expulsiones, el tráfico de descarga y la precisión en preguntas de recuperación con contexto largo.
Utiliza patrones de carga de sesiones de IA simultáneas para que la prueba incluya una superposición de sesiones real, en lugar de un único contexto máximo sintético. Mantén fijos los pesos del modelo y la cuantización.
Elige el contexto y la concurrencia máximos cuya latencia p95 y precisión con contexto largo cumplan el objetivo por debajo de aproximadamente el 85 % de la VRAM máxima. Si la reutilización de prefijos ayuda, conserva los bloques compartidos; si la expulsión perjudica la recuperación, acorta la entrada mediante memoria explícita o RAG antes de podar con mayor intensidad.
Centro de Tecnología e IA
Más para leer

¿Por qué la IA de los NVR domésticos está pasando de la detección por fotogramas a la comprensión de eventos en 2026?
Comprende cómo las trayectorias se convierten en eventos, por qué el contexto temporal reduce las alertas repetitivas y en qué aspectos la IA de...

¿Por qué el reconocimiento de voz en el dispositivo está reemplazando las canalizaciones de voz exclusivamente en la nube en 2026?
Analiza por qué la privacidad, la latencia, la resiliencia sin conexión y los modelos ASR más pequeños favorecen el reconocimiento de voz local, mientras...

¿Por qué la búsqueda multimodal se acerca cada vez más al almacenamiento doméstico en 2026?
Descubre por qué la indexación multimodal se beneficia de la localidad de los datos, cómo el almacenamiento doméstico se convierte en una capa de...

