Kaufen Sie eine lokale KI-GPU erst, wenn die Zielmodelle, die Kontextgröße, der VRAM-Bedarf, die Laufzeitunterstützung, die Stromversorgung, die Kühlung, die Geräuschentwicklung und eine gemessene CPU-Baseline bekannt sind.
Definieren Sie die Arbeitslast vor der GPU
Geben Sie die Modelle, die Quantisierung, die Kontextlänge, die Anzahl gleichzeitiger Nutzer, Bild- oder Audiofunktionen und das Latenzziel an. Inferenz, Feinabstimmung, Bildgenerierung und Video-Workloads beanspruchen Speicher und Rechenleistung unterschiedlich.
Führen Sie die vorgesehene Software zunächst auf der CPU oder einer verfügbaren GPU aus. Erfassen Sie Tokens pro Sekunde, die Zeit bis zum ersten Token, die Ladezeit des Modells und die Nutzung des Arbeitsspeichers. Ein Kauf sollte eine gemessene Lücke schließen.
- Größtes Modell und größte Quantisierung, die Sie wöchentlich ausführen werden.
- Maximale Kontextgröße und Anzahl gleichzeitiger Sitzungen.
- Erforderliche Laufzeit- und Betriebssystemunterstützung.
- Akzeptable Antwortzeit, Geräuschentwicklung und Stromkosten.
Dimensionieren Sie den VRAM für die gesamte Arbeitsmenge
Die Modellgewichte sind nur der Ausgangspunkt. Kontext-Cache, Laufzeit-Overhead, multimodale Komponenten, Batching und andere GPU-Nutzer verbrauchen ebenfalls Speicher. Lassen Sie Spielraum, statt die Planung auf die exakt beworbene Kapazität auszurichten.
Unabhängige Leitfäden zu lokaler KI betonen VRAM als zentrale Voraussetzung, da das Auslagern von Layern in den Systemspeicher die interaktive Leistung verringern kann, selbst wenn die GPU über starke Rechenleistung verfügt.
Wählen Sie die kleinste GPU, die die häufige Arbeitslast mit ausreichend Spielraum im Speicher hält. Kaufen Sie keine GPU für ein selten verwendetes Modell, wenn für diesen Sonderfall das Mieten oder ein langsameres CPU-Offloading akzeptabel ist.
Prüfen Sie die Kompatibilität von Software und Hardware
| Prüfung | Was zu überprüfen ist | Warnsignal |
|---|---|---|
| Laufzeit | Unterstütztes Backend und unterstützte Präzision | Eine Lösung aus der Community ist der einzige Weg |
| Steckplatz | Länge, Höhe, Breite und Lane-Anbindung | Der erforderliche HBA oder die NIC wird blockiert |
| Stromversorgung | Kapazität und Anschlüsse des Netzteils | Adapter überschreiten die sichere Auslegung |
| Kühlung | Frischluftzufuhr und Abluft | Umluftbetrieb oder geschlossener Schrank |
| Host | Resizable BAR/IOMMU, falls erforderlich | Die Firmware kann die erforderliche Funktion nicht bereitstellen |
Die Kompatibilität hängt von der genauen Laufzeit und Kartengeneration ab. Prüfen Sie die Anwendungen, die Sie einsetzen werden, und nicht nur eine allgemeine Support-Tabelle des Frameworks.
Ein gebrauchter Beschleuniger benötigt möglicherweise eine nicht standardmäßige Kühlung oder eine hohe Lüfterdrehzahl. Bei einer modifizierten V100 erreichte die Geräuschentwicklung trotz des attraktiven Inferenzwerts extreme Ausmaße. Das zeigt, warum der Preis pro VRAM nicht die gesamte Serverentscheidung bestimmt.
Planen Sie Stromverbrauch, Wärme, Speicher und Leerlaufkosten ein
Messen Sie die Leistungsaufnahme an der Steckdose vor dem Upgrade und schätzen Sie anschließend den Energieverbrauch im Leerlauf und unter Last anhand Ihrer tatsächlichen wöchentlichen Auslastung. Eine Karte mit hohem Leerlaufverbrauch kann im Laufe der Zeit mehr kosten, als ihr niedriger Kaufpreis vermuten lässt.
Sorgen Sie gleichzeitig für ausreichenden Luftstrom für GPU, CPU, Arbeitsspeicher und den nahegelegenen Speicher. Testen Sie die vorgesehene Raumtemperatur und den Schrank, nicht nur einen offenen Aufbau.
Bewahren Sie Modelldateien und Caches auf schnellem lokalem Speicher mit ausreichender Kapazität auf. Lassen Sie Downloads oder generierte Ausgaben nicht das Systemvolume füllen, auf dem sich Laufzeit und Protokolle befinden.
Verwenden Sie eine Kaufen-, Warten- oder Mieten-Entscheidung
Kaufen Sie, wenn die übliche Arbeitslast in den VRAM passt, die Laufzeit unterstützt wird, Gehäuse und Netzteil geeignet sind und die gemessene Nutzung häufig genug ist, um den Besitz zu rechtfertigen. Bevorzugen Sie ein Rückgaberecht, das lange genug für den Test des gesamten Servers gilt.
Warten Sie, wenn sich die Modellanforderungen noch ändern oder die CPU-Baseline das Latenzziel bereits erreicht. Mieten Sie gelegentlich größere Jobs, statt das Zuhause auf den seltenen Maximalfall auszulegen.
Nutzen Sie vor der Bereitstellung den Leitfaden für Betriebssysteme von Heimservern, um zu entscheiden, ob die KI-Laufzeit auf Bare Metal, in einer VM oder auf einem Container-Host betrieben werden sollte. Lassen Sie nicht zu, dass der GPU-Kauf versehentlich die gesamte Architektur bestimmt.
Häufig gestellte Fragen
Ist VRAM für lokale KI wichtiger als die reine GPU-Geschwindigkeit?
Oft ja, denn ein Modell und sein Kontext müssen zunächst in den Speicher passen, bevor die Rechenleistung effizient genutzt werden kann. Vergleichen Sie die vollständige Arbeitsmenge und verwenden Sie anschließend die Geschwindigkeit, um zwischen passenden Karten zu wählen.
Kann eine alte Rechenzentrums-GPU in einem Heimserver funktionieren?
Manchmal, aber prüfen Sie Treiber, Stromanschlüsse, Kühlung, Anzeigeverhalten, Leerlaufverbrauch und Geräuschentwicklung. Ein niedriger Kaufpreis kann erhebliche Integrationskosten verbergen.
Sollte ich statt einer großen Karte zwei kleinere GPUs kaufen?
Nur wenn die Laufzeit die Zielarbeitslast effizient aufteilen kann und der Host über ausreichend Lanes, Stromversorgung, Luftstrom und Abstand zwischen den Steckplätzen verfügt. Kombinierter VRAM ist für eine Anwendung nicht immer transparent.
Fazit
Kaufen Sie nur, wenn jede zwingende Anforderung im tatsächlichen Raum und Netzwerk erfüllt ist. Andernfalls warten Sie, schränken Sie den Entwurf ein oder wählen Sie eine einfachere Plattform.
Kaufanleitung
Mehr zum Lesen

Checkliste für Container-Server-Speicher vor der Erstellung eines großen Pools
Eine Checkliste für das Speicherkonzept, die verhindert, dass ein einziger praktischer Container-Pool zu einer gemeinsamen Kapazitäts- und Wiederherstellungsfehlerdomäne wird.

Checkliste zum Mischen von NAS-Laufwerken vor dem Kombinieren von Kapazitäten
Eine Checkliste vor dem Kauf und der Bereitstellung gemischter NAS-Festplatten, die versteckten Kapazitätsverlust und unvorhersehbares Wiederherstellungsverhalten verhindert.

Checkliste für den Kauf gebrauchter Server für ein leises Heimlabor
Eine praktische Prüfung vor dem Kauf gebrauchter Homelab-Hardware, bei der Akustik, Energieverbrauch, Wartungsfreundlichkeit und die Wiederherstellbarkeit des Eigentums im Vordergrund stehen.

