Come instrada un server IA domestico i modelli in base all’ingombro in memoria?

Eva Wong è la Technical Writer e smanettatrice residente di ZimaSpace. Una geek da sempre con una passione per homelab e software open-source, si specializza nel tradurre concetti tecnici complessi in guide accessibili e pratiche. Eva crede che l'auto-ospitare debba essere divertente, non intimidatorio. Attraverso i suoi tutorial, dà potere alla comunità di demistificare le configurazioni hardware, dalla costruzione del loro primo NAS al dominio dei container Docker.

Un server AI domestico instrada i modelli in base all’occupazione di memoria, associando ogni richiesta a un modello il cui intero insieme di lavoro rientri nel margine disponibile del dispositivo.

Un router locale può scegliere tra modelli linguistici piccoli e grandi, modelli di embedding, encoder per la visione, sistemi vocali e percorsi di esecuzione su CPU o GPU. Il file del checkpoint è solo il punto di partenza. L’ammissione effettiva dipende anche dai metadati di quantizzazione, dal contesto di runtime, dalla cache KV, dalla lunghezza del prompt, dalla concorrenza, dai token visivi, dagli spazi di lavoro temporanei e dalla memoria già riservata da altri servizi. Un router efficace analizza questi costi prima dell’esecuzione e sceglie un modello, una precisione, un limite di contesto e un percorso hardware in grado di rimanere stabili per l’intera richiesta.

La dimensione del checkpoint è solo la parte fissa dell’occupazione

I pesi e i metadati di quantizzazione creano una base residente prevedibile. Il runtime aggiunge poi librerie, pool dell’allocatore, grafi di esecuzione, buffer di input, attivazioni e stato della richiesta.

La guida hardware di ZimaSpace considera la memoria AI completa come qualcosa di più della sola dimensione del file del modello.

Un router che utilizza esclusivamente la dimensione del file può ammettere un modello che si carica correttamente, ma che poi si blocca durante un lungo prefill, una richiesta multimodale o una chat concorrente.

Ogni modello richiede un profilo empirico della memoria

Registra la memoria residente a riposo, la memoria di picco durante il prefill, i byte per token di contesto, la precisione della cache KV, i limiti del batch, il costo dei token visivi e la riserva di runtime per ogni modello e livello di quantizzazione.

Uno studio sulla pianificazione multi-modello del 2026 caratterizza il comportamento della memoria dei modelli su architetture e hardware eterogenei, invece di presumere che un’unica formula di posizionamento sia adatta a ogni modello.

I profili devono includere gli stati a freddo e a caldo, perché le cache di compilazione e i valori massimi dell’allocatore possono modificare la memoria disponibile dopo le richieste precedenti.

Ricrea il profilo dopo aver modificato il runtime, il driver, l’impostazione del contesto, la quantizzazione o il formato del modello.

Il router deve riservare un margine dinamico prima dell’ammissione

La richiesta fornisce informazioni aggiuntive: lunghezza del prompt, output previsto, numero e risoluzione delle immagini, batch richiesto e concorrenza attuale degli utenti.

Lo scheduler globale della memoria di Prism regola l’attivazione e l’espulsione dei modelli utilizzando le informazioni sul carico di lavoro e sulle code, invece di riserve fisse.

Un router domestico può utilizzare una formula di ammissione più semplice: la memoria libera del dispositivo, meno un margine di sicurezza, deve superare la base del modello più lo stato stimato della richiesta e lo spazio di lavoro.

Se la stima non rientra nei limiti, il router può accorciare il contesto, ridurre il batch, scegliere un modello più piccolo, usare una precisione inferiore per la cache, accodare la richiesta o instradarla verso un altro dispositivo.

Adattamento completo alla GPU, offload parziale ed esecuzione su CPU sono percorsi diversi

Un modello che rientra completamente nella VRAM evita generalmente trasferimenti ripetuti dei pesi tra host e dispositivo. Un modello più grande può funzionare tramite offload parziale sulla CPU o memoria unificata, ma con limiti diversi in termini di latenza e larghezza di banda.

ATSInfer utilizza il posizionamento a livello di tensore per coordinare archiviazione, trasferimento ed elaborazione tra la memoria della CPU e quella della GPU su dispositivi consumer.

Il router deve distinguere tra “può essere eseguito” e “rispetta la scadenza del flusso di lavoro”. Un modello con offload parziale può essere adatto a un’analisi notturna, ma inaccettabile per un’interazione vocale.

La popolarità e il costo di ricaricamento influenzano i modelli che restano residenti

I modelli richiesti frequentemente possono rimanere pronti all’uso, mentre quelli grandi e richiesti raramente possono restare sull’archiviazione finché un’attività non giustifica il costo di caricamento.

Weaver analizza i modelli molto e poco richiesti nei sistemi che servono numerosi endpoint con livelli di popolarità non uniformi.

Una richiesta può essere instradata verso un modello pronto all’uso leggermente più piccolo quando soddisfa i requisiti di qualità ed evita un lungo ciclo di espulsione e ricaricamento. Un’attività complessa può giustificare il caricamento del modello più grande quando il miglioramento di qualità previsto supera il ritardo.

I requisiti dell’attività devono limitare le decisioni basate solo sulla memoria

L’occupazione minima non è sempre il percorso corretto. Programmazione, testi multilingue, ragionamento complesso, OCR e pianificazione tramite strumenti possono richiedere funzionalità assenti in un modello più piccolo.

MuxServe combina posizionamento e pianificazione, perché l’efficienza dell’erogazione dipende sia dalla domanda dei modelli sia dal comportamento delle risorse.

Definisci prima una soglia minima di funzionalità, poi scegli il modello con l’occupazione più contenuta tra quelli che superano i test di qualità, sicurezza, latenza e formato del flusso di lavoro.

Un’attività di estrazione deterministica può essere instradata verso un piccolo modello residente, mentre una richiesta di pianificazione complessa può essere indirizzata a un modello più grande o attendere che si liberi capacità.

Il routing deve adattarsi alla memoria in tempo reale e alla cronologia recente delle esecuzioni

I profili statici non possono rilevare ogni riserva dell’allocatore, ogni area frammentata, ogni container concorrente o ogni rallentamento termico. Il router ha inoltre bisogno della memoria libera attuale, della profondità della coda, dei modelli residenti e degli errori recenti.

La ricerca sulla pianificazione agentica CPU-GPU combina l’occupazione della memoria, il costo di avvio a freddo, la cronologia delle esecuzioni e le evidenze hardware nell’assegnazione di attività AI eterogenee.

Registra il percorso scelto, la memoria prevista, il picco effettivo, il tempo di caricamento, la latenza al primo token, la velocità di output e ogni fallback. Aggiorna il profilo del modello quando l’errore di previsione supera un margine definito.

Il routing basato sulla memoria ha successo quando le richieste restano entro una capacità stabile, mentre il server continua a scegliere il modello più potente in grado di raggiungere l’obiettivo di servizio dell’attività corrente.

Domande frequenti

Un router può usare la dimensione del file del modello come stima rapida?

È una base utile, ma prima di ammettere la richiesta il router deve comunque considerare l’overhead del runtime, la cache KV, il prompt, il batch e un margine di sicurezza.

Un modello deve essere instradato sulla CPU ogni volta che la VRAM è piena?

Solo quando l’esecuzione su CPU o ibrida soddisfa i requisiti di latenza e memoria dell’attività. Potrebbe essere preferibile accodare la richiesta o selezionare un modello più piccolo.

Il routing basato sulla memoria richiede più GPU?

No. Può scegliere tra una GPU, l’esecuzione su CPU, l’offload parziale, diverse quantizzazioni e modelli di varie dimensioni su un singolo server domestico.

Hub Tecnologico e AI

Altro da leggere

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.