La fragmentación del modelo resulta útil en una red doméstica solo cuando el ahorro de memoria compensa las transferencias de activaciones, el retraso de sincronización y el desequilibrio de velocidad entre los equipos participantes.
Es posible que un modelo de 40 GB no quepa en ninguno de dos ordenadores domésticos por separado, pero sí cuando sus capas se dividen entre ambos. Cada token debe atravesar entonces la red en uno o más límites de partición, por lo que la latencia de Ethernet y el tamaño de las activaciones se suman al cómputo como parte de la inferencia. La forma de la partición, la cuantización, el equilibrio entre dispositivos, la concurrencia y la recuperación ante fallos determinan si la fragmentación es utilizable o meramente posible.
La estrategia de partición determina qué atraviesa la red
El paralelismo por canalización asigna capas consecutivas a los dispositivos y transfiere activaciones en los límites entre etapas. El paralelismo tensorial divide las operaciones dentro de una capa y normalmente requiere comunicación colectiva frecuente, mientras que el paralelismo de expertos dirige los tokens a expertos seleccionados en modelos de mezcla de expertos.
distributed transformer blocks distribuye bloques transformadores entre máquinas conectadas a través de Internet y dirige las solicitudes a los pares disponibles. Su diseño demuestra que la inferencia distribuida heterogénea es posible, pero sus condiciones de funcionamiento ponen la comunicación y la disponibilidad en primer plano.
En una Ethernet doméstica convencional, las particiones de canalización amplias suelen tolerar mejor las condiciones que las divisiones tensoriales con mucha comunicación. La cuantización reduce la memoria ocupada por los pesos, pero puede no reducir proporcionalmente las activaciones intermedias, por lo que el tamaño del archivo del modelo por sí solo no permite estimar la demanda de red. Esta distinción sigue siendo visible durante las pruebas domésticas posteriores.
El ancho de banda, la latencia y el equilibrio entre dispositivos determinan la velocidad de los tokens
Una etapa no puede avanzar hasta recibir las activaciones necesarias. Si un límite transfiere 8 MB por token, un enlace de 1 GbE tiene un límite teórico de serialización cercano a 64 milisegundos antes de contar la sobrecarga del protocolo y del cómputo; los enlaces más rápidos reducen ese límite.
automatic parallel plans busca conjuntamente planes automáticos de ejecución paralela del modelo entre dispositivos heterogéneos y enlaces de red. Esto ilustra por qué la mejor división depende de la velocidad de cómputo, la memoria, la topología y la comunicación, no de un número igual de capas. El resultado intermedio debe seguir siendo inspeccionable antes de automatizar el proceso.
La etapa más lenta limita el rendimiento sostenido, mientras que los límites de ida y vuelta dominan la latencia de los tokens para un solo usuario. La variabilidad de la wifi, los estados de ahorro de energía y las transferencias de fondo del NAS amplían la latencia de cola, incluso cuando una prueba de ancho de banda medio parece saludable. Ese límite debe medirse por separado en condiciones de funcionamiento realistas.
La coordinación del estado y la gestión de fallos determinan la fiabilidad
Todos los nodos necesitan la misma revisión del modelo, el mismo tokenizador, la misma disposición de cuantización y el mismo manifiesto de particiones. Las sumas de comprobación verifican los fragmentos antes de cargarlos, mientras que los intercambios de versiones impiden que un ordenador sirva capas de una actualización incompatible. La consecuencia práctica aparece cuando varias fuentes compiten por un contexto limitado.
disaggregated inference stages separa la precarga y la decodificación entre dispositivos porque sus necesidades de cómputo y memoria son diferentes. El trabajo demuestra que distribuir las etapas solo puede mejorar el servicio cuando la ubicación y la comunicación se ajustan a la carga de trabajo. Esta dependencia debe mantenerse explícita en la interfaz final.
El límite de fallo es un participante transitorio. Si un portátil entra en suspensión, la wifi cambia de punto de acceso o un reinicio interrumpe la única copia de una etapa, toda la solicitud se detiene. La replicación, los puntos de control reanudables o una alternativa local pueden mejorar la disponibilidad, pero cada opción consume la memoria que la fragmentación pretendía ahorrar.
Mide la división, no solo el enlace de red
Evalúa primero cada dispositivo por separado y, después, registra en cada límite de partición la forma del tensor, los bytes por token, el tiempo de copia, el tiempo de cómputo, el pico de memoria y la espera de sincronización. Prueba indicaciones cortas, precargas largas, decodificación sostenida y dos usuarios simultáneos mediante conexiones cableadas e inalámbricas.
Relaciona las mediciones con el escenario de fragmentos del NAS descrito en fragmentos de modelos en la red doméstica. Simula el reinicio de un nodo, una incompatibilidad de versiones, la saturación del enlace y un participante lento, mientras registras los tokens por segundo, la latencia del primer token, el retraso p95 entre tokens y el comportamiento de recuperación.
Usa la fragmentación solo si permite ejecutar el modelo necesario y mantiene una latencia de cola aceptable bajo una contención realista. Si la comunicación domina, elige un modelo cuantizado más pequeño, una partición más amplia o un único nodo más potente en lugar de añadir más dispositivos débiles.
Centro de Tecnología e IA
Más para leer

¿Qué funciones permiten establecer un límite de confianza de IA doméstica en torno a archivos confidenciales?
Descubre cómo la clasificación, el acceso limitado por capacidades, el análisis aislado, los filtros de recuperación, la política de salida, las aprobaciones y las...

¿Qué factores determinan si las copias de seguridad basadas en árboles de Merkle detectan cambios silenciosos de manera eficiente?
Aprende cómo el tamaño de los fragmentos, la ramificación, las raíces de confianza, los hashes almacenados en caché, la localidad de los cambios, el...

¿Qué componentes permiten realizar copias de seguridad verificables de índices de IA y del estado de los modelos?
Descubre cómo las instantáneas coordinadas, los manifiestos de contenido, las sumas de comprobación, los bloqueos de versión, los simulacros de restauración y las pruebas...

