Como é que a quantização altera a qualidade das respostas da IA local?

Eva Wong é a Redatora Técnica e e entusiasta residente na ZimaSpace. Uma geek de longa data com paixão por homelabs e software de código aberto, ela é especialista em traduzir conceitos técnicos complexos em guias acessíveis e práticos . Eva acredita que o auto-hospedagem deve ser divertida, não intimidante. Através dos seus tutoriais, ela capacita a comunidade adesmistificar configurações de hardware , desde a construção do seu primeiro NAS até dominar os contêineres Docker., from building their first NAS to mastering Docker containers.

A quantização altera a qualidade das respostas da IA local ao substituir valores de alta precisão por representações mais grosseiras, introduzindo uma aproximação numérica dependente do modelo.

A poupança de memória pode tornar viável a utilização de um modelo maior ou mais rápido em hardware doméstico, mas quatro ou oito bits não descrevem um nível de qualidade universal. Os métodos diferem quanto aos tensores que quantizam, à forma como escolhem as escalas, à proteção de valores discrepantes e aos dados de calibração utilizados. Uma pequena alteração num benchmark também pode ocultar falhas em programação, matemática, prompts multilingues, saídas estruturadas ou num fluxo de trabalho RAG privado. As secções abaixo relacionam a alteração numérica com as respostas que uma família realmente obtém.

A quantização substitui um intervalo contínuo por menos níveis representáveis

Os pesos e as ativações de vírgula flutuante conseguem expressar muitas magnitudes distintas. Os formatos com menos bits mapeiam esses valores para um conjunto menor de níveis, reduzindo o tráfego de memória e o armazenamento à custa de erros de arredondamento ou truncamento.

O GPTQ demonstra quantização de pesos com poucos bits que comprime modelos de grandes dimensões, minimizando o erro introduzido pela substituição dos pesos de precisão total.

O modelo não perde uma percentagem fixa de inteligência. A aproximação perturba muitos cálculos internos, e o efeito visível depende de essas perturbações alterarem ou não as probabilidades dos tokens relevantes para uma tarefa.

A largura de bits altera o orçamento de erro, mas não de forma perfeitamente gradual

Uma precisão superior proporciona normalmente ao quantizador mais níveis e, por conseguinte, mais margem para preservar pequenas diferenças. Passar de oito bits para quatro, três ou dois bits aumenta a pressão de compressão.

Uma avaliação abrangente concluiu que modelos quantizados a 4 bits podem continuar comparáveis às referências não quantizadas em muitos dos cenários testados, mas esse resultado não é uma garantia para todos os modelos, métodos ou distribuições de prompts.

A qualidade pode mudar abruptamente quando uma camada, um canal ou uma decisão de saída sensível ultrapassa um limiar numérico. Assim, dois níveis de quantização próximos podem comportar-se de forma semelhante em média, mas divergir numa determinada cadeia de raciocínio.

Uma compressão muito agressiva também deixa menos margem para um método proteger valores raros, mas importantes.

Os pesos, as ativações e a cache KV afetam partes diferentes da inferência

A quantização apenas dos pesos comprime os parâmetros do modelo carregados para cada pedido. A quantização de pesos e ativações também reduz a precisão dos valores intermédios produzidos durante o cálculo.

O SmoothQuant utiliza suavização das ativações para permitir pesos e ativações de oito bits, preservando a precisão nos LLM testados. O método existe porque os valores discrepantes das ativações são mais difíceis de quantizar do que os valores normais dos pesos.

A quantização da cache KV afeta o estado de atenção armazenado para o contexto atual, e não os parâmetros estáticos do modelo. Pode aumentar o contexto ou a concorrência, mas os seus erros acumulam-se através do percurso de atenção de uma forma diferente.

Uma designação como Q4 é incompleta, a menos que o runtime também identifique quais os componentes que permanecem com maior precisão.

Os valores discrepantes e os canais salientes podem ter uma importância desproporcional

Quantizar uniformemente todos os canais pressupõe que a mesma precisão é igualmente útil em toda a parte. Os modelos reais contêm canais cujos padrões de ativação tornam os seus pesos mais sensíveis ao arredondamento.

O AWQ protege canais de pesos salientes utilizando estatísticas das ativações, reduzindo o erro de quantização sem manter um modelo grande de precisão mista.

Isto explica por que motivo dois ficheiros com a mesma largura de bits nominal podem produzir qualidades diferentes. O tamanho do grupo, o método de escalonamento, o tratamento dos valores discrepantes e as camadas que permanecem não quantizadas alteram a aproximação efetiva.

Os dados de calibração podem influenciar quais os comportamentos preservados

Os métodos posteriores ao treino observam frequentemente um conjunto de dados de calibração para escolher escalas, limiares de truncamento ou transformações dos canais. Esse conjunto representa apenas uma amostra dos prompts futuros.

Estudos sobre quantização mostram que a qualidade da calibração pode afetar a recuperação da precisão, sobretudo à medida que aumenta a dimensão do modelo e a dificuldade da quantização.

Um conjunto de calibração dominado por conversas em inglês pode não proteger tokens de código, notação matemática, outra língua ou o estilo documental utilizado pela base de conhecimento de uma família.

O treino com consciência de quantização pode adaptar o modelo à baixa precisão, enquanto a quantização após o treino tem de preservar o comportamento sem um ciclo completo de novo treino. Não devem ser tratadas como equivalentes apenas porque o formato de saída tem a mesma largura de bits.

A perda de qualidade manifesta-se de forma diferente consoante as tarefas e os modelos

A perplexidade e os benchmarks abrangentes resumem o comportamento médio, mas um fluxo de trabalho local pode depender de JSON exato, argumentos corretos para ferramentas, recuperação em contextos longos, sintaxe de código ou de uma única língua especializada.

Um estudo empírico sobre o LLaMA 3 analisa a degradação específica de tarefas, em vez de presumir que uma única métrica descreve totalmente o comportamento quantizado.

Uma distribuição de probabilidades ligeiramente mais ruidosa pode passar despercebida em prosa aberta, mas quebrar uma extração determinística ou selecionar a passagem de evidência errada num sistema RAG. Os modelos mais pequenos também podem responder de forma diferente dos maiores com a mesma largura de bits.

A visão geral da IA local da ZimaSpace coloca a adequação da carga de trabalho à frente da designação do modelo. A comparação útil é a configuração quantizada que executa o fluxo de trabalho privado real, e não apenas a pontuação num leaderboard público.

Teste a quantização tendo em conta o custo das falhas do fluxo de trabalho

Crie um conjunto de avaliação fixo a partir de prompts reais: conversas normais, perguntas difíceis, chamadas de ferramentas, saídas estruturadas, documentos longos, entradas multilingues e casos em que uma resposta errada teria consequências.

Uma avaliação sistemática no dispositivo trata a capacidade e a eficiência como uma decisão conjunta, em vez de otimizar apenas a memória.

Compare a precisão total, oito bits, quatro bits e qualquer formato mais agressivo que caiba efetivamente no servidor. Registe a correção das respostas, o comportamento de recusa, a validade do formato, a latência, a memória e a repetibilidade, utilizando definições de descodificação idênticas.

A quantização adequada é o formato de menor custo que preserva o comportamento exigido pelo fluxo de trabalho. Uma pequena poupança de memória não tem valor se criar erros silenciosos, enquanto uma perda ligeira num benchmark pode ser aceitável quando permite executar localmente um modelo muito mais forte.

Centro de Tecnologia e IA

Mais para Ler

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.