La quantizzazione modifica la qualità delle risposte dell’IA locale sostituendo i valori ad alta precisione con rappresentazioni più grossolane che introducono un’approssimazione numerica dipendente dal modello.
Il risparmio di memoria può rendere pratico l’uso di un modello più grande o più veloce su hardware domestico, ma quattro o otto bit non descrivono un livello di qualità universale. I metodi differiscono per i tensori che quantizzano, il modo in cui scelgono le scale, la protezione dei valori anomali e i dati di calibrazione utilizzati. Una piccola variazione nei benchmark può inoltre nascondere problemi nella programmazione, nella matematica, nei prompt multilingue, negli output strutturati o in un flusso di lavoro RAG privato. Le sezioni seguenti collegano il cambiamento numerico alle risposte che un utente domestico vede effettivamente.
La quantizzazione sostituisce un intervallo continuo con un numero inferiore di livelli rappresentabili
I pesi e le attivazioni in virgola mobile possono esprimere molte grandezze distinte. I formati a meno bit mappano questi valori su un insieme più ristretto di livelli, riducendo il traffico di memoria e lo spazio di archiviazione al prezzo di errori di arrotondamento o ritaglio.
GPTQ dimostra la quantizzazione dei pesi a bassa precisione, che comprime i modelli di grandi dimensioni riducendo al minimo l’errore introdotto dalla sostituzione dei pesi a piena precisione.
Il modello non perde una percentuale fissa di intelligenza. L’approssimazione altera numerosi calcoli interni e l’effetto visibile dipende dal fatto che tali alterazioni modifichino o meno le probabilità dei token rilevanti per un’attività.
La larghezza in bit modifica il margine di errore, ma non in modo perfettamente graduale
Una precisione maggiore offre generalmente al quantizzatore più livelli e quindi più spazio per preservare le piccole differenze. Passare da otto bit a quattro, tre o due bit aumenta la pressione della compressione.
Una valutazione ampia ha rilevato che i modelli quantizzati a 4 bit possono rimanere comparabili ai modelli di riferimento non quantizzati in molte delle configurazioni testate, ma questo risultato non è una garanzia per ogni modello, metodo o distribuzione di prompt.
La qualità può cambiare bruscamente quando uno strato, un canale o una decisione di output sensibile supera una soglia numerica. Due livelli di quantizzazione vicini possono quindi comportarsi in modo simile in media, ma divergere in una specifica catena di ragionamento.
Una compressione molto aggressiva lascia inoltre meno margine a un metodo per proteggere i valori rari ma importanti.
Pesi, attivazioni e cache KV influenzano parti diverse dell’inferenza
La quantizzazione dei soli pesi comprime i parametri del modello caricati per ogni richiesta. La quantizzazione di pesi e attivazioni riduce anche la precisione dei valori intermedi prodotti durante il calcolo.
SmoothQuant utilizza lo smussamento delle attivazioni per supportare pesi e attivazioni a otto bit preservando la precisione negli LLM testati. Il metodo esiste perché i valori anomali delle attivazioni sono più difficili da quantizzare rispetto ai normali valori dei pesi.
La quantizzazione della cache KV influisce sullo stato di attenzione memorizzato per il contesto corrente, non sui parametri statici del modello. Può estendere il contesto o la concorrenza, ma i suoi errori si accumulano nel percorso dell’attenzione in modo diverso.
Un’etichetta come Q4 è incompleta se il runtime non indica anche quali componenti restano a una precisione maggiore.
I valori anomali e i canali più rilevanti possono avere un’importanza sproporzionata
Quantizzare uniformemente ogni canale presuppone che la stessa precisione sia ugualmente utile ovunque. I modelli reali contengono canali i cui schemi di attivazione rendono i pesi più sensibili agli errori di arrotondamento.
AWQ protegge i canali di peso più rilevanti utilizzando statistiche sulle attivazioni, riducendo l’errore di quantizzazione senza mantenere un modello di grandi dimensioni a precisione mista.
Questo spiega perché due file con la stessa larghezza nominale in bit possano produrre una qualità diversa. La dimensione del gruppo, il metodo di ridimensionamento, la gestione dei valori anomali e gli strati che restano non quantizzati modificano tutti l’approssimazione effettiva.
I dati di calibrazione possono influenzare quali comportamenti vengono preservati
I metodi successivi all’addestramento osservano spesso un set di dati di calibrazione per scegliere scale, soglie di ritaglio o trasformazioni dei canali. Quel set rappresenta solo un campione dei prompt futuri.
Gli studi sulla quantizzazione mostrano che la qualità della calibrazione può influire sul recupero della precisione, soprattutto con l’aumentare delle dimensioni del modello e della difficoltà di quantizzazione.
Un set di calibrazione dominato da conversazioni in inglese potrebbe non proteggere i token di codice, la notazione matematica, un’altra lingua o lo stile dei documenti utilizzato dalla base di conoscenza domestica.
L’addestramento consapevole della quantizzazione può adattare il modello alla bassa precisione, mentre la quantizzazione successiva all’addestramento deve preservare il comportamento senza un ciclo completo di riaddestramento. I due approcci non devono essere considerati equivalenti solo perché il formato di output ha la stessa larghezza in bit.
La perdita di qualità si manifesta in modo diverso a seconda delle attività e dei modelli
La perplessità e i benchmark generali riassumono il comportamento medio, ma un flusso di lavoro locale può dipendere da JSON esatto, argomenti corretti per gli strumenti, recupero con contesto lungo, sintassi del codice o una specifica lingua specialistica.
Uno studio empirico su LLaMA 3 esamina il degrado specifico per attività, invece di supporre che una singola metrica descriva completamente il comportamento quantizzato.
Una distribuzione delle probabilità leggermente più rumorosa può essere invisibile nella prosa a testo libero, ma compromettere l’estrazione deterministica o scegliere il passaggio di prova sbagliato in un sistema RAG. Anche i modelli più piccoli possono rispondere diversamente da quelli più grandi con la stessa larghezza in bit.
La panoramica sull’IA locale di ZimaSpace pone la compatibilità con il carico di lavoro prima dell’etichetta del modello. Il confronto utile è quello tra le configurazioni quantizzate che eseguono il flusso di lavoro privato reale, non solo il punteggio in una classifica pubblica.
Testa la quantizzazione in base al costo degli errori del flusso di lavoro
Crea un set di valutazione fisso a partire da prompt reali: conversazioni ordinarie, domande difficili, chiamate agli strumenti, output strutturati, documenti lunghi, input multilingue e casi in cui una risposta errata avrebbe conseguenze importanti.
Una valutazione sistematica sul dispositivo considera capacità ed efficienza come una decisione congiunta, invece di ottimizzare soltanto la memoria.
Confronta la piena precisione, otto bit, quattro bit e qualsiasi formato più aggressivo che entri effettivamente nel server. Registra la correttezza delle risposte, il comportamento nei rifiuti, la validità del formato, la latenza, la memoria e la ripetibilità, utilizzando impostazioni di decodifica identiche.
La quantizzazione giusta è il formato dal costo più basso che preserva il comportamento richiesto dal flusso di lavoro. Un piccolo risparmio di memoria non è utile se crea errori silenziosi, mentre una lieve perdita nei benchmark può essere accettabile quando consente di eseguire localmente un modello molto più potente.
Hub Tecnologico e AI
Altro da leggere

In che modo un broker segreto fornisce le credenziali a un agente IA senza esporle nei prompt?
Segui l'identità del carico di lavoro, le policy, l'emissione dei token, l'iniezione delle richieste, la redazione, la scadenza e la revoca attraverso un'architettura secretless...

In che modo un sandbox degli strumenti contiene gli effetti collaterali degli agenti IA?
Scopri come l'isolamento, i gate delle capacità, lo stato usa e getta, il controllo dell'egress, le quote e i log di audit limitano gli...

In che modo la decodifica vincolata produce JSON valido secondo lo schema?
Comprendi la compilazione dello schema, il mascheramento dei token, lo stato del parser, i sottoinsiemi supportati, la latenza, il troncamento e perché la validità...

