A fragmentação do modelo só é útil numa rede doméstica quando a redução da utilização de memória compensa as transferências de ativações, o atraso de sincronização e o desequilíbrio de velocidade entre os computadores participantes.
Um modelo de 40 GB pode não caber em nenhum de dois computadores domésticos, mas caber quando as respetivas camadas são divididas entre ambos. Cada token tem então de atravessar a rede num ou mais limites de partição, pelo que a latência da Ethernet e o tamanho das ativações passam a fazer parte da inferência, juntamente com a computação. A configuração das partições, a quantização, o equilíbrio entre dispositivos, a simultaneidade e a recuperação de falhas determinam se a fragmentação é utilizável ou apenas possível.
A Estratégia de Partição Determina o Que Atravessa a Rede
O paralelismo em pipeline atribui camadas consecutivas a dispositivos e transfere ativações nos limites entre etapas. O paralelismo de tensores divide as operações dentro de uma camada e, normalmente, requer comunicação coletiva frequente, enquanto o paralelismo de especialistas encaminha tokens para especialistas selecionados em modelos de mistura de especialistas.
blocos de transformadores distribuídos distribui blocos de transformadores por máquinas ligadas através da Internet e encaminha pedidos pelos pares disponíveis. O seu design demonstra que a inferência distribuída heterogénea é possível, embora as suas condições de funcionamento revelem a comunicação e a disponibilidade como limitações fundamentais.
Para uma Ethernet doméstica comum, as partições de pipeline mais amplas são normalmente mais tolerantes do que as divisões de tensores, que exigem muita comunicação. A quantização reduz a memória ocupada pelos pesos, mas pode não reduzir proporcionalmente as ativações intermédias, pelo que o tamanho do ficheiro do modelo, por si só, não permite estimar as necessidades da rede. Esta distinção continua visível durante os testes domésticos posteriores.
A Largura de Banda, a Latência e o Equilíbrio entre Dispositivos Determinam a Velocidade dos Tokens
Uma etapa não pode avançar até receber as ativações necessárias. Se um limite transferir 8 MB por token, uma ligação de 1 GbE tem um limite teórico de serialização próximo de 64 milissegundos, antes da sobrecarga do protocolo e da computação; as ligações mais rápidas reduzem esse limite.
planos de paralelismo automáticos procuram em conjunto planos de execução com paralelismo de modelos entre dispositivos heterogéneos e ligações de rede. Isto ilustra por que razão a melhor divisão depende da velocidade de computação, da memória, da topologia e da comunicação, e não de um número igual de camadas. O resultado intermédio deve continuar a ser inspecionável antes de se avançar para a automatização.
A etapa mais lenta limita o débito em regime estável, enquanto os limites de ida e volta dominam a latência dos tokens para um único utilizador. A variabilidade do Wi-Fi, os estados de poupança de energia e as transferências NAS em segundo plano aumentam a latência de cauda, mesmo quando um teste de largura de banda média parece saudável. Esse limite deve ser medido separadamente em condições de funcionamento realistas.
A Coordenação do Estado e o Tratamento de Falhas Determinam a Fiabilidade
Todos os nós precisam da mesma revisão do modelo, do mesmo tokenizador, da mesma disposição de quantização e do mesmo manifesto de partições. As somas de verificação validam os fragmentos antes do carregamento, enquanto os handshakes com controlo de versões impedem que um computador disponibilize camadas de uma atualização incompatível. A consequência prática torna-se evidente quando várias fontes competem por um contexto limitado.
etapas de inferência desagregadas separam o pré-preenchimento e a descodificação entre dispositivos, uma vez que as respetivas necessidades de computação e memória diferem. O trabalho demonstra que a distribuição das etapas só pode melhorar a disponibilização quando a colocação e a comunicação correspondem à carga de trabalho. Esta dependência deve permanecer explícita na interface final.
O limite de falha é um participante temporário. Se um portátil entrar em suspensão, ocorrer uma mudança de ponto de acesso Wi-Fi ou um reinício interromper a única cópia de uma etapa, todo o pedido é interrompido. A replicação, os pontos de verificação retomáveis ou uma alternativa local podem melhorar a disponibilidade, mas cada uma destas opções consome a memória que a fragmentação pretendia poupar.
Meça a Divisão, Não Apenas a Ligação de Rede
Faça um teste de referência a cada dispositivo isoladamente e registe, depois, a forma do tensor em cada limite de partição, os bytes por token, o tempo de cópia, o tempo de computação, o pico de memória e o tempo de espera pela sincronização. Teste prompts curtos, pré-preenchimento longo, descodificação contínua e dois utilizadores simultâneos através de ligações com e sem fios.
Relacione as medições com o cenário de fragmentos no NAS descrito em fragmentos de modelos na rede doméstica. Simule o reinício de um nó, uma incompatibilidade de versões, a saturação da ligação e um participante lento, acompanhando os tokens por segundo, a latência do primeiro token, o atraso intertokens p95 e o comportamento durante a recuperação.
Utilize a fragmentação apenas se esta permitir executar o modelo necessário e mantiver uma latência de cauda aceitável sob concorrência realista. Se a comunicação dominar, escolha um modelo quantizado mais pequeno, uma partição mais ampla ou um único nó mais potente, em vez de adicionar mais dispositivos fracos.
Centro de Tecnologia e IA
Mais para Ler

Que funcionalidades permitem criar um limite de confiança de IA doméstica em torno de ficheiros sensíveis?
Veja como a classificação, o acesso limitado por capacidades, a análise isolada, os filtros de recuperação, a política de saída de dados, as aprovações...

Que fatores determinam se as cópias de segurança baseadas em árvores de Merkle detetam alterações silenciosas de forma eficiente?
Saiba como o tamanho dos blocos, o fator de ramificação, as raízes fidedignas, os hashes em cache, a localidade das alterações, o âmbito dos...

Que componentes permitem cópias de segurança verificáveis de índices de IA e do estado dos modelos?
Veja como snapshots coordenados, manifestos de conteúdo, somas de verificação, bloqueios de versão, simulações de restauro e testes de consulta comprovam que o estado...

