Acquista una GPU AI locale solo dopo aver verificato i modelli target, la dimensione del contesto, la compatibilità con la VRAM, il supporto del runtime, l'alimentazione, il raffreddamento, la rumorosità e le prestazioni di base misurate della CPU.
Definisci il carico di lavoro prima della GPU
Indica i modelli, la quantizzazione, la lunghezza del contesto, gli utenti simultanei, le funzionalità per immagini o audio e l'obiettivo di latenza. L'inferenza, il fine-tuning, la generazione di immagini e i carichi video sottopongono memoria e potenza di calcolo a sollecitazioni diverse.
Esegui prima il software previsto sulla CPU o su una GPU disponibile. Registra i token al secondo, il tempo al primo token, il tempo di caricamento del modello e l'uso della RAM di sistema. Un acquisto deve colmare una differenza misurata.
- Il modello e la quantizzazione più grandi che eseguirai ogni settimana.
- Il contesto massimo e le sessioni simultanee.
- Il runtime e il supporto del sistema operativo richiesti.
- Il tempo di risposta, la rumorosità e il costo dell'elettricità accettabili.
Dimensiona la VRAM per l'intero set di lavoro
I pesi del modello sono solo il punto di partenza. Anche la cache del contesto, l'overhead del runtime, i componenti multimodali, il batching e gli altri processi che usano la GPU consumano memoria. Lascia un margine invece di pianificare sulla capacità pubblicizzata esatta.
Le guide indipendenti sull'AI locale sottolineano la VRAM come vincolo principale di compatibilità, perché lo spostamento dei layer nella memoria di sistema può ridurre le prestazioni interattive anche quando la GPU offre una notevole potenza di calcolo.
Scegli la GPU più economica che mantenga il carico di lavoro frequente all'interno della memoria, con un margine. Non acquistare una GPU per un modello raro se, per quel caso limite, sono accettabili il noleggio o un offload più lento sulla CPU.
Verifica la compatibilità di software e hardware
| Verifica | Cosa verificare | Segnale di stop |
|---|---|---|
| Runtime | Backend e precisione supportati | L'unica soluzione è un workaround della community |
| Slot | Lunghezza, altezza, larghezza e collegamento delle linee | Blocca l'HBA o la NIC necessari |
| Alimentazione | Capacità dell'alimentatore e connettori | Gli adattatori superano i limiti di progettazione sicuri |
| Raffreddamento | Percorso dell'aria fresca e scarico | Ricircolo dell'aria o cabinet sigillato |
| Host | Resizable BAR/IOMMU, se necessari | Il firmware non può esporre la funzionalità richiesta |
La compatibilità varia in base al runtime esatto e alla generazione della scheda. Verifica le applicazioni che distribuirai, non solo una tabella generica di supporto del framework.
Un acceleratore usato potrebbe richiedere un raffreddamento non standard o una velocità elevata delle ventole. Una V100 modificata ha raggiunto un livello di rumorosità estremo nonostante l'interessante valore per l'inferenza, dimostrando perché il prezzo per GB di VRAM non è l'unico fattore nella scelta del server.
Considera alimentazione, calore, archiviazione e costi in idle
Misura il consumo alla presa prima dell'aggiornamento, quindi stima l'energia consumata in idle e sotto carico in base al tuo reale ciclo di utilizzo settimanale. Una scheda che consuma molto in idle può costare di più nel tempo di quanto suggerisca il suo basso prezzo di acquisto.
Fornisci un flusso d'aria sufficiente contemporaneamente per GPU, CPU, memoria e unità di archiviazione vicine. Verifica la temperatura prevista della stanza e il cabinet effettivi, non un banco di prova aperto.
Conserva i file dei modelli e le cache su un'unità locale veloce con spazio sufficiente. Non lasciare che download o output generati riempiano il volume di sistema che contiene il runtime e i log.
Usa una soglia per decidere se acquistare, aspettare o noleggiare
Acquista quando il carico di lavoro comune rientra nella VRAM, il runtime è supportato, chassis e alimentatore superano le verifiche e l'utilizzo misurato è abbastanza frequente da giustificare la proprietà. Preferisci un periodo di reso abbastanza lungo da testare l'intero server.
Aspetta quando i requisiti dei modelli stanno ancora cambiando o la configurazione di base della CPU soddisfa già l'obiettivo di latenza. Noleggia risorse per i lavori più grandi occasionali invece di progettare l'ambiente domestico intorno al raro caso massimo.
Prima della distribuzione, usa la guida ai sistemi operativi per home server per decidere se il runtime AI debba essere eseguito direttamente sull'hardware, in una macchina virtuale o su un host di container. Non lasciare che l'acquisto della GPU determini accidentalmente l'intera architettura.
Domande frequenti
La VRAM è più importante della velocità grezza della GPU per l'AI locale?
Spesso sì, perché un modello e il suo contesto devono entrare nella memoria prima che la potenza di calcolo possa essere utilizzata in modo efficiente. Confronta l'intero set di lavoro, quindi usa la velocità per scegliere tra le schede compatibili.
Una vecchia GPU per data center può funzionare in un home server?
A volte, ma verifica driver, connettori di alimentazione, raffreddamento, comportamento del display, consumo in idle e rumorosità. Un prezzo di acquisto basso può nascondere costi di integrazione notevoli.
Devo acquistare due GPU più piccole invece di una scheda grande?
Solo quando il runtime può distribuire in modo efficiente il carico di lavoro target e l'host dispone di linee, alimentazione, flusso d'aria e spazio tra gli slot sufficienti. La VRAM combinata non è sempre trasparente per un'applicazione.
Conclusione
Acquista solo quando ogni requisito vincolante è soddisfatto nella stanza e nella rete reali; altrimenti aspetta, restringi il progetto o scegli una piattaforma più semplice.
Guida all'acquisto
Altro da leggere

Checklist dello storage del server container prima di un unico pool di grandi dimensioni
Una checklist di progettazione dello storage che impedisce a un unico comodo pool di container di diventare un unico dominio condiviso di guasto della...

Checklist per combinare unità NAS di capacità diverse
Una checklist pre-acquisto e pre-distribuzione per dischi NAS misti che previene sprechi nascosti di capacità e comportamenti di ripristino imprevedibili.

Checklist per acquistare un server usato per un laboratorio domestico silenzioso
Un controllo pratico pre-acquisto per hardware homelab usato che dà priorità ad acustica, consumi energetici, manutenibilità e proprietà recuperabile.

