Un servidor de IA doméstico distribuye los modelos según su huella de memoria, asociando cada solicitud con un modelo cuyo conjunto de trabajo completo cabe en la memoria disponible del dispositivo.
Un enrutador local puede elegir entre modelos de lenguaje pequeños y grandes, modelos de embeddings, codificadores de visión, sistemas de voz y rutas de ejecución en CPU o GPU. El archivo de checkpoint solo es el punto de partida. La admisión real también depende de los metadatos de cuantización, el contexto de ejecución, la caché KV, la longitud del prompt, la concurrencia, los tokens de visión, los espacios de trabajo temporales y la memoria ya reservada por otros servicios. Un enrutador útil perfila esos costes antes de la ejecución y elige un modelo, una precisión, un límite de contexto y una ruta de hardware que puedan mantenerse estables durante toda la solicitud.
El tamaño del checkpoint solo representa la parte fija de la huella
Los pesos y los metadatos de cuantización crean una base residente predecible. Después, el entorno de ejecución añade bibliotecas, grupos del asignador de memoria, grafos de ejecución, búferes de entrada, activaciones y el estado de la solicitud.
La guía de hardware de ZimaSpace considera que la memoria total de IA abarca más que el tamaño del archivo del modelo.
Un enrutador que solo utiliza el tamaño del archivo puede admitir un modelo que se carga correctamente, pero falla durante un prellenado prolongado, una solicitud multimodal o un chat simultáneo.
Cada modelo necesita un perfil de memoria empírico
Registra la memoria residente en reposo, la memoria máxima durante el prellenado, los bytes por token de contexto, la precisión de la caché KV, los límites de lote, el coste de los tokens visuales y la reserva del entorno de ejecución para cada modelo y cuantización.
Un estudio de programación multimodelo de 2026 caracteriza el comportamiento de la memoria de los modelos en distintas arquitecturas y hardware heterogéneo, en lugar de asumir que una única fórmula de asignación sirve para todos los modelos.
Los perfiles deben incluir estados en frío y en caliente, porque las cachés de compilación y los picos máximos del asignador pueden cambiar la memoria disponible después de solicitudes anteriores.
Vuelve a crear el perfil después de cambiar el entorno de ejecución, el controlador, la configuración de contexto, la cuantización o el formato del modelo.
El enrutador debe reservar memoria dinámica antes de admitir una solicitud
La solicitud aporta información adicional: longitud del prompt, salida prevista, número y resolución de las imágenes, lote solicitado y concurrencia actual de usuarios.
El programador global de memoria de Prism ajusta la activación y expulsión de modelos utilizando información de la carga de trabajo y de la cola, en lugar de reservas fijas.
Un enrutador doméstico puede utilizar una fórmula de admisión más sencilla: la memoria libre del dispositivo menos un margen de seguridad debe superar la base del modelo más el estado estimado de la solicitud y el espacio de trabajo.
Si la estimación no cabe, el enrutador puede acortar el contexto, reducir el lote, elegir un modelo más pequeño, usar una precisión menor para la caché, poner la solicitud en cola o dirigirla a otro dispositivo.
El ajuste completo en GPU, la descarga parcial y la ejecución en CPU son rutas diferentes
Un modelo que cabe por completo en la VRAM normalmente evita transferencias repetidas de pesos entre el host y el dispositivo. Un modelo más grande puede ejecutarse mediante descarga parcial a la CPU o memoria unificada, pero con una latencia y unos límites de ancho de banda diferentes.
ATSInfer utiliza la asignación a nivel de tensor para coordinar el almacenamiento, las transferencias y el cálculo entre la memoria de la CPU y la GPU de dispositivos de consumo.
El enrutador debe distinguir entre «se puede ejecutar» y «cumple el plazo del flujo de trabajo». Un modelo descargado parcialmente puede ser adecuado para un análisis nocturno y resultar inaceptable para una interacción de voz.
La popularidad y el coste de recarga influyen en qué modelos permanecen residentes
Los modelos solicitados con frecuencia pueden permanecer en caliente, mientras que los modelos grandes y poco habituales pueden mantenerse en el almacenamiento hasta que una tarea justifique el coste de cargarlos.
Weaver analiza los modelos populares y poco utilizados en sistemas que sirven muchos endpoints con una popularidad desigual.
Una solicitud puede dirigirse a un modelo en caliente ligeramente más pequeño cuando cumple los requisitos de calidad y evita un largo ciclo de expulsión y recarga. Una tarea difícil puede justificar la carga del modelo más grande cuando la mejora de calidad prevista supera la demora.
Los requisitos de la tarea deben limitar las decisiones basadas solo en la memoria
La huella más pequeña no siempre es la ruta correcta. La programación, el texto multilingüe, el razonamiento complejo, el OCR y la planificación de herramientas pueden requerir capacidades ausentes en un modelo más pequeño.
MuxServe combina la asignación y la programación, porque la eficiencia del servicio depende tanto de la demanda de los modelos como del comportamiento de los recursos.
Define primero un umbral mínimo de capacidades y, después, elige el modelo con menor huella entre los que superen las pruebas de calidad, seguridad, latencia y formato del flujo de trabajo.
Una tarea de extracción determinista puede dirigirse a un modelo pequeño residente, mientras que una solicitud de planificación difícil puede enviarse a un modelo más grande o esperar a que haya capacidad.
El enrutamiento debe adaptarse a la memoria disponible y al historial reciente de ejecución
Los perfiles estáticos no pueden reflejar todas las reservas del asignador, las regiones fragmentadas, los contenedores que compiten por recursos ni la ralentización térmica. El enrutador también necesita conocer la memoria libre actual, la profundidad de la cola, los modelos residentes y los fallos recientes.
La investigación sobre programación agéntica de CPU y GPU combina las huellas de memoria, el coste de arranque en frío, el historial de ejecución y las evidencias del hardware al asignar trabajo de IA heterogéneo.
Registra la ruta elegida, la memoria prevista, el pico real, el tiempo de carga, la latencia hasta el primer token, la velocidad de salida y cualquier alternativa utilizada. Actualiza el perfil del modelo cuando el error de predicción supere un margen definido.
El enrutamiento consciente de la memoria tiene éxito cuando las solicitudes se mantienen dentro de una capacidad estable y el servidor sigue eligiendo el modelo más potente capaz de cumplir el objetivo de servicio de la tarea actual.
Preguntas frecuentes
¿Puede un enrutador utilizar el tamaño del archivo del modelo como estimación rápida?
Es una base útil, pero el enrutador aún necesita tener en cuenta la sobrecarga del entorno de ejecución, la caché KV, el prompt, el lote y un margen de seguridad antes de admitir la solicitud.
¿Debe una solicitud dirigirse a la CPU siempre que la VRAM esté llena?
Solo cuando la ejecución en CPU o híbrida cumpla los requisitos de latencia y memoria de la tarea. Poner la solicitud en cola o elegir un modelo más pequeño puede ser mejor.
¿El enrutamiento consciente de la memoria requiere varias GPU?
No. Puede elegir entre una GPU, la ejecución en CPU, la descarga parcial, distintas cuantizaciones y varios tamaños de modelo en un único servidor doméstico.
Centro de Tecnología e IA
Más para leer

¿Qué funciones permiten establecer un límite de confianza de IA doméstica alrededor de archivos confidenciales?
Un límite de confianza para la IA doméstica combina cifrado en reposo, permisos de mínimo privilegio, aislamiento del entorno de ejecución y recuperación con...

¿Qué hace que los resultados de búsqueda privados favorezcan los archivos editados con frecuencia?
Los archivos editados con frecuencia obtienen ventajas de posicionamiento cuando cada actualización añade señales de frescura, fragmentos, versiones o interacción sin normalizarlas por fuente.

¿Qué hace que los modelos de presencia del hogar inteligente confundan a los invitados con los residentes?
Los invitados pueden parecer residentes cuando el sistema observa patrones de actividad del hogar, pero carece de una señal de identidad estable de la...

