Wie verändert Quantisierung die Qualität lokaler KI-Antworten?

Eva Wong ist die Technische Redakteurin und und leidenschaftliche Tüftlerin bei ZimaSpace. Eine lebenslange Geek mit einer Leidenschaft für Homelabs und Open-Source-Software, sie spezialisiert sich darauf, komplexe technische Konzepte in zugängliche, praktische Anleitungenzu übersetzen. Eva ist der Meinung, dass Self-Hosting Spaß machen und nicht einschüchternd sein sollte. Durch ihre Tutorials befähigt sie die Community, Hardware-Setups zu entmystifizieren, vom Bau ihres ersten NAS bis hin zur Beherrschung von Docker-Containern.

Quantisierung verändert die Qualität lokaler KI-Antworten, indem hochpräzise Werte durch gröbere Darstellungen ersetzt werden, die eine modellabhängige numerische Näherung einführen.

Die eingesparte Speicherkapazität kann ein größeres oder schnelleres Modell auf Hardware zu Hause praktikabel machen. Vier oder acht Bit beschreiben jedoch kein einheitliches Qualitätsniveau. Die Methoden unterscheiden sich darin, welche Tensoren quantisiert werden, wie sie Skalierungsfaktoren bestimmen, ob sie Ausreißer schützen und welche Kalibrierungsdaten sie verwenden. Eine kleine Änderung im Benchmark kann außerdem Fehler bei Programmierung, Mathematik, mehrsprachigen Prompts, strukturierten Ausgaben oder einem privaten RAG-Workflow verbergen. Die folgenden Abschnitte stellen den Zusammenhang zwischen der numerischen Änderung und den Antworten her, die ein Haushalt tatsächlich erhält.

Quantisierung ersetzt einen kontinuierlichen Wertebereich durch weniger darstellbare Stufen

Gleitkomma-Gewichte und -Aktivierungen können viele unterschiedliche Größenordnungen ausdrücken. Formate mit weniger Bits ordnen diese Werte einer kleineren Anzahl von Stufen zu. Dadurch werden Speicherzugriffe und Speicherbedarf reduziert, allerdings um den Preis von Rundungs- oder Clipping-Fehlern.

GPTQ demonstriert eine Quantisierung von Gewichten mit wenigen Bits, die große Modelle komprimiert und gleichzeitig den Fehler minimiert, der beim Ersetzen von Gewichten mit voller Präzision entsteht.

Das Modell verliert keinen festen Prozentsatz an Intelligenz. Die Näherung verändert viele interne Berechnungen, und die sichtbare Auswirkung hängt davon ab, ob diese Veränderungen die für eine Aufgabe relevanten Token-Wahrscheinlichkeiten beeinflussen.

Die Bitbreite verändert das Fehlerbudget, aber nicht völlig gleichmäßig

Eine höhere Präzision bietet dem Quantisierer normalerweise mehr Stufen und damit mehr Spielraum, kleine Unterschiede zu bewahren. Der Wechsel von acht zu vier, drei oder zwei Bits erhöht den Komprimierungsdruck.

Eine umfassende Untersuchung kam zu dem Ergebnis, dass Modelle mit 4-Bit-Quantisierung in vielen getesteten Szenarien mit nicht quantisierten Referenzmodellen vergleichbar bleiben können. Dieses Ergebnis ist jedoch keine Garantie für jedes Modell, jede Methode oder jede Prompt-Verteilung.

Die Qualität kann sich abrupt verändern, wenn eine empfindliche Schicht, ein Kanal oder eine Ausgabeentscheidung eine numerische Schwelle überschreitet. Zwei nahe beieinanderliegende Quantisierungsstufen können sich daher im Durchschnitt ähnlich verhalten, bei einer bestimmten Schlussfolgerungskette jedoch auseinanderlaufen.

Eine sehr aggressive Komprimierung lässt einer Methode außerdem weniger Spielraum, seltene, aber wichtige Werte zu schützen.

Gewichte, Aktivierungen und der KV-Cache beeinflussen unterschiedliche Teile der Inferenz

Die Quantisierung ausschließlich der Gewichte komprimiert die Modellparameter, die für jede Anfrage geladen werden. Bei der Quantisierung von Gewichten und Aktivierungen wird zusätzlich die Präzision der Zwischenwerte reduziert, die während der Berechnung entstehen.

SmoothQuant verwendet eine Glättung der Aktivierungen, um acht Bit für Gewichte und Aktivierungen zu unterstützen und gleichzeitig die Genauigkeit bei den getesteten LLMs zu erhalten. Die Methode wurde entwickelt, weil Ausreißer in Aktivierungen schwieriger zu quantisieren sind als gewöhnliche Gewichtswerte.

Die Quantisierung des KV-Caches betrifft den gespeicherten Aufmerksamkeitszustand des aktuellen Kontexts und nicht die statischen Modellparameter. Sie kann den Kontext oder die Anzahl paralleler Anfragen erweitern, ihre Fehler sammeln sich jedoch auf andere Weise über den Aufmerksamkeitsweg an.

Eine Bezeichnung wie Q4 ist unvollständig, wenn die Laufzeitumgebung nicht zusätzlich angibt, welche Komponenten mit höherer Präzision verbleiben.

Ausreißer und besonders wichtige Kanäle können eine überproportionale Bedeutung haben

Bei der einheitlichen Quantisierung jedes Kanals wird angenommen, dass überall dieselbe Präzision gleichermaßen nützlich ist. Tatsächlich enthalten Modelle Kanäle, deren Aktivierungsmuster ihre Gewichte empfindlicher gegenüber Rundungen machen.

AWQ schützt besonders wichtige Gewichtskanäle mithilfe von Aktivierungsstatistiken. Dadurch wird der Quantisierungsfehler verringert, ohne ein großes Modell mit gemischter Präzision beibehalten zu müssen.

Das erklärt, warum zwei Dateien mit derselben nominellen Bitbreite eine unterschiedliche Qualität liefern können. Gruppengröße, Skalierungsmethode, Umgang mit Ausreißern und die weiterhin nicht quantisierten Schichten verändern jeweils die effektive Näherung.

Kalibrierungsdaten können beeinflussen, welche Verhaltensweisen erhalten bleiben

Methoden zur Quantisierung nach dem Training verwenden häufig einen Kalibrierungsdatensatz, um Skalierungsfaktoren, Clipping-Schwellen oder Kanaltransformationen zu bestimmen. Dieser Datensatz stellt jedoch nur eine Stichprobe der zukünftigen Prompts dar.

Untersuchungen zur Quantisierung zeigen, dass die Qualität der Kalibrierung die Wiederherstellung der Genauigkeit beeinflussen kann, insbesondere wenn Modellgröße und Quantisierungsschwierigkeit zunehmen.

Ein Kalibrierungsdatensatz, der überwiegend aus englischen Gesprächen besteht, schützt möglicherweise keine Code-Token, mathematische Notation, eine andere Sprache oder den Dokumentstil, der in der Wissensdatenbank eines Haushalts verwendet wird.

Quantisierungsbewusstes Training kann das Modell an eine geringe Präzision anpassen, während die Quantisierung nach dem Training das Verhalten ohne einen vollständigen erneuten Trainingszyklus erhalten muss. Beide Verfahren sollten nicht als gleichwertig betrachtet werden, nur weil das Ausgabeformat dieselbe Bitbreite besitzt.

Qualitätsverluste zeigen sich je nach Aufgabe und Modell unterschiedlich

Perplexität und umfassende Benchmarks fassen das durchschnittliche Verhalten zusammen. Ein lokaler Workflow kann jedoch von exakt formatiertem JSON, korrekten Tool-Argumenten, dem Abruf aus langen Kontexten, fehlerfreier Codesyntax oder einer einzelnen spezialisierten Sprache abhängen.

Eine empirische Untersuchung zu LLaMA 3 betrachtet aufgabenspezifische Verschlechterungen, anstatt davon auszugehen, dass eine einzelne Kennzahl das Verhalten eines quantisierten Modells vollständig beschreibt.

Eine geringfügig verrauschtere Wahrscheinlichkeitsverteilung kann in frei formulierten Texten unbemerkt bleiben, aber eine deterministische Extraktion stören oder dazu führen, dass in einem RAG-System der falsche Belegabschnitt ausgewählt wird. Kleinere Modelle können sich bei derselben Bitbreite außerdem anders verhalten als größere Modelle.

Die Übersicht zur lokalen KI von ZimaSpace stellt die Eignung für den konkreten Workload vor die Modellbezeichnung. Der sinnvolle Vergleich ist die quantisierte Konfiguration, die im tatsächlichen privaten Workflow läuft, und nicht nur ein Wert aus einer öffentlichen Bestenliste.

Teste die Quantisierung anhand der Fehlerkosten des Workflows

Erstelle einen festen Testsatz aus echten Prompts: gewöhnliche Chats, schwierige Fragen, Tool-Aufrufe, strukturierte Ausgaben, lange Dokumente, mehrsprachige Eingaben und Fälle, in denen eine falsche Antwort Folgen hätte.

Eine systematische Bewertung auf dem Gerät betrachtet Fähigkeiten und Effizienz als gemeinsame Entscheidungsgrundlage, statt ausschließlich den Speicherbedarf zu optimieren.

Vergleiche volle Präzision, acht Bit, vier Bit und jedes aggressivere Format, das tatsächlich auf den Server passt. Erfasse Antwortkorrektheit, Verweigerungsverhalten, Gültigkeit des Formats, Latenz, Speicherbedarf und Reproduzierbarkeit bei identischen Dekodierungseinstellungen.

Die richtige Quantisierung ist das kostengünstigste Format, das das erforderliche Verhalten des Workflows erhält. Eine geringe Speicherersparnis ist nicht wertvoll, wenn sie stille Fehler verursacht. Umgekehrt kann ein kleiner Benchmark-Verlust akzeptabel sein, wenn dadurch ein deutlich stärkeres Modell lokal ausgeführt werden kann.

Tech- & KI-Zentrum

Mehr zum Lesen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.