El almacenamiento en caché del modelo cambia el tiempo de respuesta al permitir que las solicitudes repetidas reutilicen archivos descargados, pesos residentes en memoria, kernels compilados o el estado del prompt procesado previamente.
Un servidor de IA doméstico no tiene una única caché universal. El artefacto del modelo puede ya existir en el almacenamiento local, las páginas de sus archivos pueden permanecer en la RAM del sistema, los pesos pueden seguir cargados en la memoria del acelerador, el código de ejecución compilado puede reutilizarse y un prompt del sistema repetido aún puede tener un estado KV válido. Cada capa elimina una parte diferente del recorrido de la solicitud. Las secciones siguientes separan esas capas para evitar confundir una segunda respuesta rápida con una generación más veloz del modelo o con un hardware mejor.
El almacenamiento en caché del modelo abarca varias capas independientes
La primera distinción útil es saber qué se ha almacenado en caché. Un checkpoint descargado evita la transferencia de red, la caché de páginas del sistema de archivos evita volver a leer algunos bloques del almacenamiento, los pesos residentes evitan cargar el modelo, los artefactos compilados evitan el trabajo de configuración y la caché de prefijos evita recalcular los tokens compartidos del prompt.
La investigación sobre el almacenamiento en caché multinivel considera el arranque del modelo como un movimiento entre el almacenamiento, la memoria del host y la memoria del acelerador, en lugar de como un único estado binario frío o caliente. Una solicitud puede estar caliente en una capa y fría en otra.
Esto explica por qué decir «el modelo está en caché» es insuficiente. El servidor puede tener los archivos localmente, pero aun así necesitar asignar VRAM, cargar los pesos, compilar kernels y procesar el prompt antes de producir un token.
La caché de artefactos elimina la demora de descarga y del repositorio
Cuando los archivos del modelo ya están materializados en el servidor doméstico, el arranque evita la autenticación, las comprobaciones de metadatos del repositorio, el ancho de banda remoto y la descarga de fragmentos de varios gigabytes. El entorno de ejecución puede comenzar desde la copia local.
Netflix describe el almacenamiento en caché de artefactos del modelo como algo necesario porque descargar pesos grandes durante el arranque supera la latencia práctica del programador. El mismo mecanismo es importante en casa cuando se recrea un contenedor o se inicia un modelo después de una limpieza.
La caché de artefactos no garantiza un primer token rápido. Un checkpoint local puede seguir estando en un disco lento, usar muchos fragmentos, requerir conversión o competir con lecturas y escrituras del NAS.
La caché del sistema de archivos puede acelerar mucho la segunda carga
Después de que el sistema operativo lee los archivos del modelo, las páginas limpias de los archivos pueden permanecer en la RAM del sistema que no se esté utilizando. Un lanzamiento posterior puede recuperar esos datos desde la memoria en lugar de esperar de nuevo al dispositivo de almacenamiento.
MAIO mejora el arranque de los LLM al optimizar la política de caché del sistema de archivos utilizada durante la carga del modelo. Sus resultados muestran por qué dos lanzamientos desde la misma ruta NVMe pueden tener tiempos de lectura diferentes, según qué páginas del modelo permanezcan en la caché.
Esta caché puede recuperarse para otros usos. Las copias de seguridad, el servicio de archivos, las bases de datos u otro modelo pueden desplazar esas páginas, por lo que una respuesta que fue rápida ayer puede volver a depender del almacenamiento después de una presión de memoria o un reinicio.
Las pruebas de rendimiento que no definen el estado de la caché de páginas mezclan dos regímenes de almacenamiento y pueden exagerar la mejora obtenida al actualizar una unidad.
Los pesos residentes eliminan el mayor límite de recarga
Mantener los pesos en la RAM, la memoria unificada o la VRAM permite que el entorno de ejecución avance directamente hacia el procesamiento del prompt. Descargar el modelo libera capacidad para otras aplicaciones, pero hace que la siguiente solicitud vuelva a pagar el coste de carga.
La guía de ZimaSpace sobre la residencia del modelo muestra el patrón característico: una solicitud lenta después de la expulsión, seguida de respuestas normales mientras el modelo permanece caliente.
La residencia cambia principalmente la preparación y el tiempo hasta el primer token. No necesariamente aumenta la tasa de tokens generados una vez que comienza la generación.
Mantener todos los modelos residentes también puede crear la presión de memoria que provoque la expulsión de otro modelo, de la caché KV o de una aplicación del servidor doméstico.
Las cachés de compilación y de kernels eliminan el trabajo de la primera ejecución
Algunos entornos de ejecución especializan kernels, capturan grafos de ejecución o compilan código para el modelo activo, la arquitectura de la GPU, las formas de los tensores y la configuración del entorno. La primera solicitud compatible puede realizar un trabajo que las siguientes reutilizan.
Un análisis práctico del arranque en frío señala que la compilación del entorno de ejecución puede situarse entre la carga de los pesos y la entrega de la primera respuesta. Una caché de compilación persistente desplaza ese coste fuera de los arranques posteriores hasta que un cambio en el modelo, el controlador, el entorno de ejecución o el hardware la invalida.
Esto crea otro estado caliente: los archivos y los pesos pueden estar ya presentes, pero la primera forma nueva o la primera ruta de ejecución nueva aún puede causar un pico de latencia.
La caché de prefijos reduce el procesamiento inicial, pero no la decodificación de tokens nuevos
Un prompt del sistema repetido, un prefijo de documento largo o un bloque de instrucciones compartido normalmente requiere que el modelo procese los mismos tokens de nuevo antes de llegar a la nueva entrada del usuario. Una caché de prefijos almacena el estado de atención reutilizable de ese procesamiento inicial anterior.
La investigación de Prompt Cache informa de una menor latencia hasta el primer token cuando las solicitudes reutilizan módulos de prompt largos. El beneficio crece con la longitud del prefijo compartido porque se puede omitir una mayor parte del procesamiento inicial.
No acelera prompts nuevos arbitrarios ni elimina el coste de decodificar tokens de salida nuevos. Los aciertos de caché dependen de una reutilización del prefijo exacta o compatible, de la capacidad disponible de la caché y de la política de expulsión del entorno de ejecución.
Mide las rutas frías y calientes como clases de respuesta separadas
Prueba una solicitud fija después de reiniciar, después de cargar el modelo, después de una repetición inmediata, después de un periodo largo de inactividad y después de una carga de trabajo simultánea. Registra por separado la descarga del artefacto, la lectura del almacenamiento, la carga del modelo, la compilación, la evaluación del prompt, el primer token y la tasa de tokens de salida.
El análisis de caché fría advierte que la latencia con caché caliente puede ocultar una cola más lenta cuando algunas solicitudes no encuentran datos en la caché. Un asistente doméstico debe evaluarse según la combinación de situaciones que los usuarios encuentran realmente, no solo mediante una prueba repetida inmediata.
Una vez identificada la capa que falla, la solución se vuelve específica: precargar los archivos del modelo, conservar margen para la caché de páginas, ampliar el tiempo de permanencia del modelo, conservar los artefactos compilados o activar la reutilización de prefijos para prompts compartidos estables.
Preguntas frecuentes
¿Un modelo almacenado en caché siempre usa menos RAM?
No. Algunas cachés consumen deliberadamente RAM o VRAM para reducir el trabajo futuro. Intercambian capacidad por una menor latencia, en lugar de reducir el uso de memoria.
¿Por qué la primera respuesta es lenta y las siguientes son rápidas?
La primera solicitud puede cargar los pesos, asignar el estado del entorno de ejecución, compilar kernels o procesar un prompt largo. Las solicitudes posteriores reutilizan uno o más de esos resultados.
¿Borrar las cachés puede corregir respuestas incorrectas de la IA?
En algunos casos puede reparar artefactos del entorno de ejecución obsoletos o dañados, pero las cachés del modelo normalmente afectan a la carga y a la reutilización de cálculos, no a la calidad factual de unos pesos y prompts que no han cambiado.
Centro de Tecnología e IA
Más para leer

¿Por qué las predicciones del hogar inteligente son menos precisas después de los cambios estacionales en la rutina?
Las rutinas estacionales cambian la relación entre el tiempo, los sensores, la ocupación y las acciones deseadas, lo que vuelve obsoleto un modelo entrenado...

¿Por qué un NVR doméstico no registra eventos breves cuando el seguimiento de objetos está activado?
El seguimiento necesita suficientes detecciones para iniciar y confirmar una trayectoria, por lo que un objeto que aparece brevemente puede desaparecer antes de que...

¿Por qué cambian las etiquetas de las fotos generadas por IA después de actualizar el modelo?
Una actualización del modelo cambia la representación y la clasificación utilizadas para asignar etiquetas, por lo que la misma foto puede cruzar diferentes límites...

