Os modelos locais quantizados podem perder precisão no seguimento de instruções quando prompts estruturados longos amplificam pequenos erros numéricos através de muitas restrições interligadas e decisões sobre tokens.
Um pedido curto pode solicitar um facto ou formato, enquanto um prompt estruturado longo pode combinar regras de função, esquemas aninhados, requisitos de ordenação, exclusões, exemplos, evidências obtidas e verificações de saída em várias etapas. A quantização reduz a memória do modelo ao aproximar pesos, ativações ou o estado de execução, mas essa aproximação não afeta todos os comportamentos de forma igual. O modelo pode manter a fluência e, ainda assim, omitir um campo, violar uma instrução tardia, confundir a hierarquia ou afastar-se de um contrato de resposta exato. As secções abaixo relacionam a representação de baixa precisão com estas falhas visíveis no seguimento de instruções.
A Quantização Altera os Valores Internos Sem Alterar o Prompt
A quantização pós-treino mapeia valores de maior precisão para um número menor de níveis representáveis. Os tokens do prompt permanecem idênticos, mas as ativações ocultas e os cálculos de probabilidade utilizados para os interpretar são ligeiramente alterados.
Uma avaliação abrangente de várias famílias de modelos concluiu que os efeitos da quantização variam consoante as famílias de modelos, os objetivos numéricos e as categorias de tarefas, em vez de produzirem uma única perda universal de precisão.
O texto livre pode tolerar pequenas alterações na probabilidade dos tokens, porque várias continuações continuam a ser aceitáveis. As instruções estruturadas são menos tolerantes quando apenas um nome de campo, delimitador, ordenação ou condição de recusa cumpre o contrato.
O Seguimento de Instruções Pode Degradar-se Antes da Fluência Geral
Um modelo quantizado pode continuar a escrever parágrafos coerentes e a responder a perguntas familiares, tornando-se, ainda assim, menos consistente no cumprimento de restrições explícitas.
Trabalhos recentes estudam especificamente a perda no seguimento de instruções após a quantização e tratam-na como um comportamento que pode exigir uma recuperação direcionada, em vez de uma otimização normal da perplexidade.
Isto cria um resultado de teste local enganador: a resposta parece competente, mas falta uma chave obrigatória, surge uma secção proibida ou o modelo segue um exemplo com mais força do que a regra efetiva.
Por isso, a validação deve avaliar separadamente o cumprimento do contrato, a legibilidade e a correção temática.
Os Prompts Longos Tornam Mais Importantes a Posição e a Competição Entre Restrições
Os prompts estruturados distribuem frequentemente as instruções pelo início, meio e fim do contexto. Documentos obtidos e exemplos podem inserir milhares de tokens concorrentes entre a regra e a saída.
A investigação sobre contextos longos demonstra uma utilização sensível à posição da informação, mesmo antes de introduzir a quantização.
A quantização pode reduzir a margem que separa a interpretação correta de uma alternativa próxima. Uma regra já fracamente representada devido à sua posição ou ao contexto concorrente torna-se mais fácil de ignorar.
Repetir todas as instruções não é uma solução limpa. Aumenta o comprimento do prompt e pode criar conflitos adicionais, a menos que a hierarquia seja explícita.
Os Dados de Calibração Podem Não Representar o Comportamento com Prompts Estruturados
Muitos métodos pós-treino escolhem escalas ou o comportamento de recorte a partir de uma amostra de calibração. Uma amostra dominada por texto comum pode não preservar os mesmos padrões de ativação que esquemas JSON, blocos de código, tabelas ou instruções longas com várias partes.
As ferramentas de quantização distinguem métodos que exigem dados de calibração de abordagens dinâmicas ou conscientes do treino.
Um conjunto de calibração pode preservar o comportamento linguístico médio, sub-representando, contudo, o fluxo de trabalho exato que é importante no servidor doméstico.
Utilize amostras que contenham os modelos de prompt, idiomas, separadores, esquemas e estilos documentais efetivamente utilizados pelo modelo implementado.
A Precisão do Cache KV Pode Afetar as Partes Posteriores de uma Resposta Longa
Alguns ambientes de execução quantizam não só os pesos do modelo, mas também o cache de chave-valor que armazena o estado de atenção do contexto ativo.
A Google Research descreve a quantização do cache KV como uma forma de reduzir o custo de memória do contexto de longo alcance, preservando simultaneamente o desempenho de geração.
O cache representa os tokens anteriores do prompt e da saída. A aproximação nesse ponto pode afetar a forma como a descodificação posterior presta atenção a requisitos aninhados ou à estrutura gerada anteriormente.
Por isso, as configurações apenas com pesos e com pesos mais cache devem ser avaliadas separadamente, em vez de serem agrupadas sob uma única designação genérica de número de bits.
A Fiabilidade Estruturada Exige Testes de Fluxo de Trabalho de Ponta a Ponta
Teste o ficheiro quantizado exato, o ambiente de execução, o comprimento do contexto, o formato do cache, as definições de amostragem e o analisador de saída utilizados em produção. Um benchmark do modelo base não pode certificar uma conversão local diferente.
A NVIDIA recomenda avaliar os compromissos específicos do modelo, porque a memória, o débito e a qualidade variam consoante a técnica de inferência e o percurso de hardware selecionados.
Os limites de implementação local da ZimaSpace também distinguem entre o facto de um modelo carregar e o facto de se manter fiável no contexto e na concorrência pretendidos.
Crie testes estruturados adversariais com objetos aninhados, campos opcionais, restrições tardias, texto padrão repetido, exemplos contraditórios e casos de recusa. A quantização adequada é o formato de menor precisão que continua a ultrapassar o limiar de precisão no seguimento de instruções exigido pelo fluxo de trabalho.
FAQ
Uma perplexidade mais baixa garante um melhor seguimento de instruções?
Não. A perplexidade mede a adequação preditiva a sequências de tokens, enquanto a precisão no seguimento de instruções pode depender de restrições exatas, da validade do esquema e do comportamento de recusa.
Um modelo quantizado maior seguirá sempre as instruções melhor do que um modelo mais pequeno de precisão total?
Não. A capacidade do modelo, o alinhamento, o método de quantização, o comprimento do prompt, o ambiente de execução e o contrato da tarefa influenciam todos o resultado.
A reformulação do prompt pode recuperar todas as falhas de quantização?
Não. Uma hierarquia clara e prompts mais curtos podem ajudar, mas as falhas persistentes podem exigir um formato de maior precisão, um quantizador diferente ou outro modelo.
Centro de Tecnologia e IA
Mais para Ler

Que funcionalidades permitem criar um limite de confiança de IA doméstico em torno de ficheiros sensíveis?
Uma fronteira de confiança para IA doméstica combina encriptação em repouso, permissões de privilégio mínimo, sandboxing em tempo de execução e recuperação com âmbito...

O que faz com que os resultados de pesquisa privada favoreçam ficheiros editados com frequência?
Os ficheiros editados frequentemente obtêm vantagens no posicionamento quando cada atualização acrescenta sinais de atualidade, fragmentos, versões ou interação, sem normalização por fonte.

O que faz com que os modelos de presença de casas inteligentes confundam visitantes com residentes?
Os visitantes podem parecer residentes quando o sistema observa padrões de atividade doméstica, mas não dispõe de um sinal de identidade estável da pessoa...

