Varios modelos locales pueden compartir un mismo acelerador cuando la capa de servicio coordina la permanencia de pesos en memoria, la memoria dinámica, el tiempo de ejecución y el aislamiento de solicitudes entre cargas de trabajo.
Una GPU doméstica puede alternar entre un modelo de chat, un modelo de embeddings, un codificador de visión y un sistema de reconocimiento de voz. Cargar permanentemente todos los conjuntos de pesos puede superar la VRAM disponible, mientras que descargarlos en cada solicitud vuelve irregular la latencia hasta el primer token. Un controlador multimodelo necesita una política de permanencia, contabilidad de memoria entre modelos, programación, aislamiento de caché, desalojo y equidad, en lugar de depender de procesos independientes que compitan a ciegas.
La política de permanencia decide qué pesos permanecen disponibles
El controlador registra el tamaño del modelo, la tasa de llegada, el tiempo de carga, el objetivo de latencia y el uso reciente. Los modelos populares permanecen en memoria, los poco frecuentes ocupan la CPU o el almacenamiento, y la demanda prevista puede activar la precarga antes de que la siguiente solicitud llegue al acelerador.
precarga multimodelo prepara trabajadores universales de GPU para varios modelos y coordina la precarga con una colocación consciente del desalojo. Sus resultados muestran por qué evitar una carga en frío puede mejorar drásticamente el tiempo hasta el primer token cuando la demanda es predecible. Esta diferencia sigue siendo visible durante las pruebas domésticas posteriores.
Las decisiones de permanencia deben incluir las variantes de cuantización y adaptadores, porque dos endpoints aparentemente similares pueden contener pesos base diferentes. Un presupuesto de memoria estricto evita que la carga proactiva desaloje la caché KV de las solicitudes activas. El resultado intermedio debe seguir siendo inspeccionable antes de que la automatización continúe.
La coordinación de memoria entre modelos evita la fragmentación de la capacidad
Los pesos son mayormente estables, mientras que las activaciones y las cachés KV crecen con el tamaño del lote y la longitud de la secuencia. Un asignador compartido puede asignar páginas de memoria bajo demanda, recuperar regiones inactivas y exponer reservas para impedir que un modelo consuma el espacio prometido a otro.
coordinación de memoria entre modelos introduce la coordinación de memoria entre modelos mediante la asignación dinámica de páginas virtuales a físicas y políticas de compartición en tiempo de ejecución. El diseño explica por qué la compartición de GPU a nivel de proceso convencional no puede responder bien a una demanda de modelos que cambia rápidamente. Ese límite debe medirse por separado en condiciones operativas realistas.
Compartir memoria no equivale a compartir datos. Los bloques de caché KV, las cachés de prefijos, los búferes temporales y el estado de los adaptadores requieren identificadores de inquilino y de modelo; de lo contrario, una página reutilizada o una clave de caché pueden filtrar el contexto o corromper los resultados entre endpoints.
La programación y la multiplexación de adaptadores controlan el tiempo de ejecución
Un planificador elige entre la compartición espacial, en la que los modelos ocupan memoria simultáneamente, y la compartición temporal, en la que los kernels se turnan. El procesamiento continuo por lotes mejora el rendimiento, mientras que el desalojo y las colas ponderadas protegen una solicitud interactiva frente a un trabajo en segundo plano prolongado.
multiplexación de adaptadores sirve miles de adaptadores de bajo rango sobre modelos base compartidos mediante la paginación de los pesos de los adaptadores y la coordinación de lotes heterogéneos. Demuestra que la especialización puede compartir más estado que las réplicas de modelos completamente independientes. La consecuencia práctica aparece cuando varias fuentes compiten por un contexto limitado.
El límite de fallo está en la interferencia entre kernels y memoria. Dos modelos que caben simultáneamente pueden aun así incumplir los objetivos de latencia cuando compiten por el cómputo, el ancho de banda o los motores de copia. Compartir resulta útil solo cuando la latencia p95 y la equidad de cada modelo se mantienen dentro de la política, no cuando el uso agregado simplemente parece elevado.
Construye una matriz de interferencia del uso compartido de modelos
Mide cada modelo por separado y, después, ejecuta cada par importante y la combinación prevista de cuatro modelos con solicitudes cortas, largas, en ráfagas y en segundo plano. Registra el tiempo de carga en frío, la memoria residente, el crecimiento de la caché KV, el uso de los kernels, el rendimiento, la latencia p50 y p95, y los desalojos.
Usa el principio de pila enrutada de permanencia de modelos enrutada para asignar una prioridad y una clase de permanencia a cada endpoint. Repite las pruebas con adaptadores, variantes cuantizadas, procesamiento continuo por lotes y desalojo, comprobando que las cachés y las identidades de las solicitudes permanezcan aisladas.
Conserva una política de uso compartido solo cuando los modelos interactivos importantes cumplan su objetivo de latencia durante la combinación más exigente prevista. Si un par provoca una saturación repetida, serializa ese par o reserva una ventana de tiempo en lugar de aumentar la concurrencia para obtener un gráfico de utilización más favorable.
Centro de Tecnología e IA
Más para leer

¿Qué funciones permiten establecer un límite de confianza de IA doméstica en torno a archivos confidenciales?
Descubre cómo la clasificación, el acceso limitado por capacidades, el análisis aislado, los filtros de recuperación, la política de salida, las aprobaciones y las...

¿Qué factores determinan si las copias de seguridad basadas en árboles de Merkle detectan cambios silenciosos de manera eficiente?
Aprende cómo el tamaño de los fragmentos, la ramificación, las raíces de confianza, los hashes almacenados en caché, la localidad de los cambios, el...

¿Qué componentes permiten realizar copias de seguridad verificables de índices de IA y del estado de los modelos?
Descubre cómo las instantáneas coordinadas, los manifiestos de contenido, las sumas de comprobación, los bloqueos de versión, los simulacros de restauración y las pruebas...

