El estado de ejecución de la IA debe separarse de los archivos del modelo porque los pesos inmutables y las cachés mutables requieren permisos, copias de seguridad, actualizaciones y reglas de recuperación diferentes.
Un contenedor local de IA puede leer un punto de control del modelo mientras escribe continuamente metadatos de descarga, kernels compilados, cachés de indicaciones, estado de conversaciones, cargas temporales, archivos de bloqueo, registros y capturas del asignador. Colocar todos esos archivos en un único directorio escribible dificulta determinar qué es autoritativo, desechable, privado, específico de una versión o seguro de eliminar. Las secciones siguientes explican cómo una estructura dividida protege la integridad del modelo y permite que el estado de ejecución evolucione, caduque y se recupere de forma independiente.
Los artefactos del modelo y el estado de ejecución tienen ciclos de vida diferentes
Los pesos del modelo, los recursos del tokenizador, la configuración y los metadatos de cuantización normalmente solo cambian cuando se instala una revisión específica del modelo. Los archivos de ejecución pueden cambiar con cada solicitud o reinicio.
Las recomendaciones de Harbor para la gestión de modelos aplican la inmutabilidad de los artefactos a los archivos grandes de IA para que una revisión identificada siga siendo reproducible. Mezclar entradas de caché mutables en esa ruta de artefactos debilita el significado de una versión del modelo.
Un límite claro trata el directorio del modelo como una entrada versionada y el directorio de ejecución como un estado generado. La ejecución puede reconstruirse sin cambiar silenciosamente los pesos instalados.
Una ruta del modelo de solo lectura limita los cambios accidentales y maliciosos
Un servicio de inferencia normalmente necesita leer los archivos del modelo, no reescribirlos en cada solicitud. Montar esa ruta como de solo lectura evita que un complemento comprometido, una tarea de limpieza defectuosa o un comando incorrecto del contenedor reemplace los fragmentos del punto de control.
Las recomendaciones de seguridad para contenedores aconsejan rutas escribibles limitadas para registros, caché y archivos temporales, en lugar de conceder al proceso un árbol completo de la aplicación con permisos de escritura.
El almacenamiento de solo lectura no demuestra que el modelo sea confiable, pero conserva los bytes instalados después de su verificación y hace que las escrituras inesperadas fallen de forma visible.
Las nuevas revisiones del modelo deben incorporarse mediante un paso controlado de importación o despliegue, no mediante los mismos permisos utilizados para atender las indicaciones de los usuarios.
Los kernels compilados y las cachés de ejecución pertenecen al estado de ejecución
Los motores de inferencia pueden compilar kernels o grafos de ejecución para un modelo de GPU, controlador, compilación del marco, forma de tensor y configuración determinados. Estos artefactos pueden acelerar los inicios posteriores, pero se derivan del entorno.
NVIDIA Engineering describe el estado de ejecución inicializado como una fuente independiente de retrasos en el arranque en frío respecto de los propios pesos del modelo. Una actualización del controlador o del entorno de ejecución puede invalidar ese estado aunque el punto de control no haya cambiado.
Almacena las cachés de compilación y de kernels en una raíz de caché de ejecución versionada. Así podrán purgarse o regenerarse sin eliminar la copia autoritativa del modelo.
Las cachés de conversación y de prefijos contienen datos específicos del usuario
La caché KV, la caché de indicaciones, los pasajes recuperados, las cargas temporales y la memoria de sesión pueden contener o codificar contexto del hogar. Sus reglas de privacidad y caducidad no son las mismas que las de los pesos públicos del modelo.
La arquitectura de LMCache separa el estado de la caché KV de los trabajadores de inferencia para que la reutilización de la caché pueda sobrevivir a los cambios de trabajadores. Esta separación también convierte la propiedad, la conservación y la limpieza en una responsabilidad operativa diferenciada.
La guía de ZimaSpace sobre el contexto por usuario muestra por qué las cachés de ejecución deben seguir la identidad del usuario, en lugar de heredar la política general de uso compartido de un único directorio común del modelo.
No hagas copias de seguridad automáticas del estado temporal de las indicaciones solo porque se realizan copias de seguridad de los archivos del modelo. Primero determina si ese estado es necesario, privado, reproducible y si aún se encuentra dentro de su periodo de conservación.
Las rutas separadas hacen previsibles las actualizaciones y las reversiones
Una actualización debería poder reemplazar la imagen de ejecución o activar una nueva revisión del modelo conservando únicamente el estado compatible. Cuando el código, los archivos del modelo y los datos generados están mezclados, una reversión puede restaurar una combinación incoherente.
Un patrón de despliegue inmutable mantiene explícitas las ubicaciones del estado de la aplicación. Una actualización fallida del entorno de ejecución puede reemplazarse mientras las rutas persistentes siguen siendo inspeccionables y las revisiones del modelo permanecen sin cambios.
Usa directorios de modelos versionados y un puntero activo atómico en lugar de sobrescribir los pesos directamente. Asigna a cada versión de ejecución un espacio de nombres de caché compatible cuando los artefactos compilados no puedan compartirse de forma segura.
Las políticas de copia de seguridad y limpieza deben seguir el valor de los datos
Los archivos del modelo pueden volver a descargarse, estar ajustados localmente, tener licencia o ser costosos de reconstruir. El estado de ejecución abarca desde archivos temporales desechables hasta conversaciones valiosas y adaptadores locales irreemplazables.
La estrategia de artefactos del modelo destaca la trazabilidad del modelo para identificar los pesos y la configuración exactos que respaldan un despliegue. En cambio, las copias de seguridad del estado de ejecución deben seleccionarse según el valor empresarial, la privacidad y la capacidad de recuperación.
Excluye de las copias de seguridad rutinarias las cachés de kernels regenerables, las descargas incompletas y los tensores temporales. Protege los ajustes finos, los adaptadores, los historiales aprobados por los usuarios y la configuración mediante sus propias rutas de restauración probadas.
La limpieza del disco se vuelve más segura cuando la expulsión de la caché no puede recorrer los pesos del modelo y la depuración de modelos no puede borrar el estado activo de los usuarios.
Diseña la estructura de almacenamiento en torno a contratos explícitos
Usa rutas separadas para las revisiones inmutables del modelo, la selección del modelo activo, las descargas en curso, los artefactos compilados, la caché de indicaciones o KV, las sesiones de usuario, los registros y las cargas temporales. Registra el propietario, los permisos, la cuota, la conservación y la política de copias de seguridad de cada una.
Un patrón de registro de modelos nativo de la nube utiliza artefactos de modelos versionados para que el estado del despliegue pueda apuntar a un modelo específico sin tratar los archivos de ejecución generados como parte de esa revisión.
Realiza pruebas haciendo que la ruta del modelo sea de solo lectura, eliminando únicamente la ruta de caché, reiniciando el entorno de ejecución, revirtiendo su imagen y restaurando el estado del usuario sin restaurar los artefactos compilados. Cada operación debería afectar únicamente a la capa indicada en el procedimiento.
Preguntas frecuentes
¿Deben separarse los archivos de modelos descargados y la caché del modelo?
Como mínimo, separa las revisiones completas y verificadas de las descargas incompletas y los metadatos mutables. Una caché de descargas con direccionamiento por contenido puede seguir alimentando una ruta del modelo desplegado de solo lectura.
¿Se puede eliminar la caché de ejecución de forma segura?
Solo después de identificar su contenido. Las cachés de kernels y compilación normalmente pueden regenerarse, mientras que el estado de las indicaciones, las sesiones de usuario, los adaptadores o la base de datos de la aplicación puede no ser recuperable.
¿La separación requiere unidades físicas diferentes?
No. Los conjuntos de datos, volúmenes, directorios, permisos y reglas de copia de seguridad separados pueden establecer el límite del ciclo de vida en un único grupo de almacenamiento. Los dispositivos diferentes son útiles cuando se necesita rendimiento o aislamiento frente a fallos.
Centro de Tecnología e IA
Más para leer

¿Por qué las predicciones del hogar inteligente son menos precisas después de los cambios estacionales en la rutina?
Las rutinas estacionales cambian la relación entre el tiempo, los sensores, la ocupación y las acciones deseadas, lo que vuelve obsoleto un modelo entrenado...

¿Por qué un NVR doméstico no registra eventos breves cuando el seguimiento de objetos está activado?
El seguimiento necesita suficientes detecciones para iniciar y confirmar una trayectoria, por lo que un objeto que aparece brevemente puede desaparecer antes de que...

¿Por qué cambian las etiquetas de las fotos generadas por IA después de actualizar el modelo?
Una actualización del modelo cambia la representación y la clasificación utilizadas para asignar etiquetas, por lo que la misma foto puede cruzar diferentes límites...

