Koop pas een lokale AI-GPU wanneer de doelmodellen, contextgrootte, VRAM-passing, runtime-ondersteuning, stroomvoorziening, koeling, geluidsniveau en gemeten CPU-baseline bekend zijn.
Bepaal de werklast voordat je de GPU kiest
Noteer de modellen, kwantisatie, contextlengte, gelijktijdige gebruikers, beeld- of audiofuncties en gewenste latentie. Inferentie, fine-tuning, beeldgeneratie en videowerkbelastingen belasten geheugen en rekenkracht op verschillende manieren.
Voer de beoogde software eerst uit op de CPU of een beschikbare GPU. Noteer tokens per seconde, tijd tot het eerste token, laadtijd van het model en het gebruik van het systeem-RAM. Een aankoop moet een gemeten tekort oplossen.
- Het grootste model en de kwantisatie die je wekelijks uitvoert.
- Maximale context en aantal gelijktijdige sessies.
- Vereiste runtime- en besturingssysteemondersteuning.
- Acceptabele responstijd, geluidsniveau en elektriciteitskosten.
Stem de VRAM af op de volledige werkset
Modelgewichten zijn slechts het begin. Contextcache, runtime-overhead, multimodale componenten, batching en andere GPU-gebruikers verbruiken ook geheugen. Houd marge aan in plaats van precies de geadverteerde capaciteit te plannen.
Onafhankelijke richtlijnen voor lokale AI benadrukken VRAM als een belangrijke geschiktheidsbeperking, omdat het doorschuiven van lagen naar het systeemgeheugen de interactieve prestaties kan verminderen, zelfs wanneer de GPU sterke rekenprestaties levert.
Kies de kleinste GPU die de veelvoorkomende werklast met voldoende marge in het geheugen houdt. Koop geen GPU voor een zeldzaam model als huren of tragere CPU-offloading voor dat uitzonderlijke geval acceptabel is.
Controleer software- en hardwarecompatibiliteit
| Controle | Wat je moet verifiëren | Stopteken |
|---|---|---|
| Runtime | Ondersteunde backend en precisie | Een oplossing uit de community is de enige route |
| Slot | Lengte, hoogte, breedte en lane-bedrading | Blokkeert de vereiste HBA of NIC |
| Stroom | PSU-capaciteit en aansluitingen | Adapters overschrijden het veilige ontwerp |
| Koeling | Toevoer van frisse lucht en afvoer | Luchtcirculatie of een afgesloten kast |
| Host | Resizable BAR/IOMMU indien nodig | Firmware kan de vereiste functie niet beschikbaar maken |
Compatibiliteit verandert afhankelijk van de exacte runtime en kaartgeneratie. Verifieer de toepassingen die je gaat implementeren, niet alleen een generieke ondersteuningstabel voor frameworks.
Een gebruikte accelerator heeft mogelijk niet-standaardkoeling of een hoge ventilatorsnelheid nodig. Een aangepaste V100-uitvoering bereikte extreem veel geluid ondanks de aantrekkelijke inferentiewaarde, wat laat zien waarom de prijs per VRAM niet de enige factor is bij een serverbeslissing.
Plan voor stroom, warmte, opslag en kosten bij inactiviteit
Meet het stroomverbruik aan de wand voordat je uitbreidt en schat vervolgens het energieverbruik bij inactiviteit en belasting in op basis van je werkelijke wekelijkse gebruikscyclus. Een kaart die in rust veel verbruikt, kan na verloop van tijd meer kosten dan de lage aanschafprijs doet vermoeden.
Zorg tegelijkertijd voor voldoende luchtstroom voor de GPU, CPU, het geheugen en nabijgelegen opslag. Test bij de beoogde kamertemperatuur en in de beoogde kast, niet op een open testbank.
Bewaar modelbestanden en caches op snelle lokale opslag met voldoende ruimte. Laat downloads of gegenereerde uitvoer niet het systeemvolume vullen waarop de runtime en logboeken staan.
Gebruik een kopen-, wachten- of huren-beslissing
Koop wanneer de veelvoorkomende werklast in de VRAM past, de runtime wordt ondersteund, de behuizing en PSU geschikt zijn en het gemeten gebruik frequent genoeg is om eigendom te rechtvaardigen. Geef de voorkeur aan een retourtermijn die lang genoeg is om de volledige server te testen.
Wacht wanneer de modelvereisten nog veranderen of de CPU-baseline al aan de latentiedoelstelling voldoet. Huur incidenteel grotere taken in plaats van je thuisomgeving rond het zeldzame maximum te ontwerpen.
Gebruik vóór de implementatie de gids voor besturingssystemen voor homeservers om te bepalen of de AI-runtime op bare metal, in een VM of op een containerhost hoort te draaien. Laat de aankoop van de GPU niet per ongeluk de volledige architectuur bepalen.
Veelgestelde vragen
Is VRAM belangrijker dan de ruwe GPU-snelheid voor lokale AI?
Vaak wel, omdat een model en de context eerst moeten passen voordat rekenkracht efficiënt kan worden benut. Vergelijk de volledige werkset en gebruik daarna de snelheid om te kiezen tussen kaarten die passen.
Kan een oude datacenter-GPU in een homeserver werken?
Soms, maar controleer stuurprogramma's, stroomaansluitingen, koeling, weergavegedrag, verbruik in rust en geluidsniveau. Een lage aanschafprijs kan aanzienlijke integratiekosten verbergen.
Moet ik twee kleinere GPU's kopen in plaats van één grote kaart?
Alleen wanneer de runtime de doelwerklast efficiënt kan verdelen en de host voldoende lanes, stroom, luchtstroom en ruimte tussen de slots heeft. Gecombineerde VRAM is niet altijd transparant voor een toepassing.
Conclusie
Koop alleen wanneer aan elke harde eis wordt voldaan in de echte ruimte en op het echte netwerk; wacht anders, beperk het ontwerp of kies een eenvoudiger platform.
Koopgids
Meer om te lezen

Checklist voor container-serveropslag vóór één grote pool
Een checklist voor opslagontwerp die voorkomt dat één handige containerpool uitgroeit tot één gedeeld capaciteits- en herstelstoringsdomein.

Checklist voor het mixen van NAS-schijven voordat je capaciteiten combineert
Een checklist vóór aankoop en implementatie voor gemengde NAS-schijven die verborgen capaciteitsverspilling en onvoorspelbaar herstelgedrag voorkomt.

Checklist voor het kopen van een gebruikte server voor een stil thuislab
Een praktische controle vóór aankoop van gebruikte homelab-hardware, met prioriteit voor geluidsniveau, energieverbruik, onderhoudbaarheid en herstelbaar eigenaarschap.

