Kvantisering förändrar kvaliteten på lokala AI-svar genom att ersätta högprecisionsvärden med grövre representationer som introducerar modellberoende numeriska approximationer.
Minnesbesparingen kan göra en större eller snabbare modell praktisk på hemm hårdvara, men fyra eller åtta bitar beskriver inte en universell kvalitetsnivå. Metoderna skiljer sig åt i vilka tensorer de kvantiserar, hur de väljer skalor, om de skyddar avvikande värden och vilka kalibreringsdata de använder. En liten förändring i ett riktmärke kan också dölja problem med kodning, matematik, flerspråkiga frågor, strukturerade utdata eller ett privat RAG-arbetsflöde. Avsnitten nedan kopplar den numeriska förändringen till de svar ett hushåll faktiskt ser.
Kvantisering ersätter ett kontinuerligt intervall med färre representerbara nivåer
Flyttalsvikter och aktiveringar kan uttrycka många olika storlekar. Format med lägre bitdjup mappar dessa värden till en mindre uppsättning nivåer, vilket minskar minnestrafik och lagring på bekostnad av avrundnings- eller klippningsfel.
GPTQ demonstrerar lågbitars kvantisering av vikter som komprimerar stora modeller samtidigt som felet som uppstår när fullprecisionsvikter ersätts minimeras.
Modellen förlorar inte en fast procentandel av sin intelligens. Approximationen påverkar många interna beräkningar, och den synliga effekten beror på om dessa förändringar ändrar sannolikheterna för de token som är relevanta för en uppgift.
Bitdjupet förändrar felbudgeten, men inte på ett helt jämnt sätt
Högre precision ger vanligtvis kvantiseraren fler nivåer och därmed större utrymme att bevara små skillnader. Övergången från åtta bitar till fyra, tre eller två bitar ökar komprimeringstrycket.
En bred utvärdering fann att 4-bitarskvantiserade modeller kan förbli jämförbara med okvantiserade baslinjer i många testade situationer, men resultatet är ingen garanti för varje modell, metod eller frågefördelning.
Kvaliteten kan förändras abrupt när ett känsligt lager, en kanal eller ett utdataresultat passerar en numerisk tröskel. Två närliggande kvantiseringsnivåer kan därför bete sig likartat i genomsnitt men skilja sig åt i en specifik tankekedja.
Mycket aggressiv komprimering lämnar också mindre utrymme för en metod att skydda sällsynta men viktiga värden.
Vikter, aktiveringar och KV-cache påverkar olika delar av inferensen
Kvantisering av enbart vikter komprimerar modellparametrarna som laddas för varje förfrågan. Kvantisering av vikter och aktiveringar minskar även precisionen hos de mellanvärden som skapas under beräkningen.
SmoothQuant använder utjämning av aktiveringar för att stödja åttabitarsvikter och aktiveringar samtidigt som noggrannheten bevaras i testade LLM:er. Metoden finns eftersom avvikande aktiveringsvärden är svårare att kvantisera än vanliga viktvärden.
KV-cache-kvantisering påverkar det lagrade uppmärksamhetstillståndet för den aktuella kontexten i stället för de statiska modellparametrarna. Den kan utöka kontexten eller samtidigheten, men felen ackumuleras genom uppmärksamhetsvägen på ett annat sätt.
En beteckning som Q4 är ofullständig om körmiljön inte också anger vilka komponenter som behåller högre precision.
Avvikande värden och framträdande kanaler kan ha oproportionerligt stor betydelse
Att kvantisera varje kanal enhetligt förutsätter att samma precision är lika användbar överallt. I verkliga modeller finns kanaler vars aktiveringsmönster gör deras vikter känsligare för avrundning.
AWQ skyddar framträdande viktkanaler med hjälp av aktiveringsstatistik, vilket minskar kvantiseringsfelet utan att en stor modell med blandad precision behöver behållas.
Detta förklarar varför två filer med samma nominella bitdjup kan ge olika kvalitet. Gruppstorlek, skalningsmetod, hantering av avvikande värden och vilka lager som förblir okvantiserade förändrar alla den effektiva approximationen.
Kalibreringsdata kan påverka vilka beteenden som bevaras
Metoder efter träning observerar ofta en kalibreringsuppsättning för att välja skalor, klippningströsklar eller kanaltransformationer. Den uppsättningen representerar bara ett urval av framtida frågor.
Kvantiseringsstudier visar att kalibreringskvaliteten kan påverka hur väl noggrannheten återställs, särskilt när modellens storlek och kvantiseringssvårigheten ökar.
En kalibreringsuppsättning som domineras av engelsk konversation kanske inte skyddar kodtoken, matematisk notation, ett annat språk eller den dokumentstil som används i ett hushålls kunskapsbas.
Kvantiseringsmedveten träning kan anpassa modellen till låg precision, medan kvantisering efter träning måste bevara beteendet utan en fullständig omträningscykel. De bör inte behandlas som likvärdiga enbart för att utdataformatet har samma bitdjup.
Kvalitetsförlust visar sig olika för olika uppgifter och modeller
Perplexitet och breda riktmärken sammanfattar genomsnittligt beteende, men ett lokalt arbetsflöde kan vara beroende av exakt JSON, korrekta verktygsargument, hämtning från lång kontext, kodsyntax eller ett enskilt specialiserat språk.
En empirisk studie av LLaMA 3 undersöker uppgiftsspecifik försämring i stället för att anta att ett enda mått helt beskriver kvantiserat beteende.
En något brusigare sannolikhetsfördelning kan vara osynlig i fri prosa men ändå bryta deterministisk extraktion eller välja fel evidenspassage i RAG. Mindre modeller kan också reagera annorlunda än större modeller vid samma bitdjup.
ZimaSpaces översikt över lokal AI sätter arbetsbelastningens passning före modellbeteckningen. Den användbara jämförelsen är den kvantiserade konfiguration som kör det faktiska privata arbetsflödet, inte bara ett offentligt resultat på en topplista.
Testa kvantisering mot arbetsflödets kostnad för fel
Skapa en fast utvärderingsuppsättning från verkliga frågor: vanlig chatt, svåra frågor, verktygsanrop, strukturerade utdata, långa dokument, flerspråkig inmatning och fall där ett felaktigt svar skulle spela roll.
En systematisk utvärdering på enheten behandlar funktionalitet och effektivitet som ett gemensamt beslut i stället för att enbart optimera minnet.
Jämför full precision, åtta bitar, fyra bitar och alla mer aggressiva format som faktiskt får plats på servern. Registrera svarens korrekthet, vägransbeteende, formatgiltighet, svarstid, minnesanvändning och repeterbarhet med identiska avkodningsinställningar.
Rätt kvantisering är det kostnadseffektivaste formatet som bevarar det beteende arbetsflödet kräver. En liten minnesbesparing är inte värdefull om den skapar tysta fel, medan en mindre förlust i ett riktmärke kan vara acceptabel om den gör det möjligt att köra en betydligt starkare modell lokalt.
Teknik- och AI-hubb
Mer att läsa

Vilka funktioner möjliggör en AI-förtroendegräns i hemmet runt känsliga filer?
En förtroendegräns för AI i hemmet kombinerar kryptering i vila, behörigheter enligt principen om minsta privilegium, sandlådeförsörjning vid körning och avgränsad informationshämtning – ingen...

Vad gör att privata sökresultat prioriterar filer som redigeras ofta?
Filer som redigeras ofta får rankingfördelar när varje uppdatering lägger till färskhet, delar, versioner eller interaktionssignaler utan att normalisera efter källa.

Vad får modeller för närvaro i smarta hem att förväxla gäster med boende?
Gäster kan se ut som boende när systemet observerar aktivitetsmönster i hushållet men saknar en stabil identitetssignal för personen som ger upphov till dem.

