Amostragem de LLM local: por que as definições de descodificação alteram a repetição e a estabilidade

Eva Wong é a Redatora Técnica e e entusiasta residente na ZimaSpace. Uma geek de longa data com paixão por homelabs e software de código aberto, ela é especialista em traduzir conceitos técnicos complexos em guias acessíveis e práticos . Eva acredita que o auto-hospedagem deve ser divertida, não intimidante. Através dos seus tutoriais, ela capacita a comunidade adesmistificar configurações de hardware , desde a construção do seu primeiro NAS até dominar os contêineres Docker., from building their first NAS to mastering Docker containers.

As definições de descodificação alteram o comportamento dos LLM locais ao redefinirem quais os tokens seguintes que continuam elegíveis e o grau de influência das diferenças de probabilidade em cada seleção.

Um modelo doméstico pode responder de forma consistente a uma pergunta factual e, ainda assim, tornar-se repetitivo durante uma longa sessão de voz ou instável na escrita criativa. Os pesos não mudam; o descodificador seleciona de forma diferente, a cada passo, a partir da respetiva distribuição de probabilidades. A temperatura, o truncamento, as penalizações de repetição, a semente e o contexto determinam em conjunto se o resultado entra em ciclos familiares ou deriva para continuações de baixa probabilidade.

A temperatura redimensiona a confiança antes da escolha de um token

Em cada passo, o modelo atribui logit a possíveis tokens. A temperatura redimensiona esses logits antes da normalização: valores mais baixos acentuam as diferenças e favorecem os líderes, enquanto valores mais altos as suavizam e atribuem mais probabilidade a candidatos mais fracos. A descodificação gulosa ignora a amostragem e escolhe sempre o máximo atual.

Uma explicação técnica distingue a temperatura e os filtros de tokens: a temperatura altera as probabilidades relativas em toda a distribuição, o top-k mantém um número fixo de candidatos e o top-p mantém o conjunto mais pequeno que atinge uma determinada massa de probabilidade. Estes controlos estão relacionados, mas não são intercambiáveis.

Uma aleatoriedade baixa pode estabilizar a formatação e a formulação factual, mas também pode escolher repetidamente a mesma continuação localmente apelativa. Uma aleatoriedade elevada pode escapar a esse padrão, mas também admitir erros. A estabilidade significa, portanto, uma variância controlada para a tarefa, não simplesmente a temperatura mais baixa.

Os filtros dinâmicos alteram o conjunto de candidatos à medida que a confiança muda

O top-p utiliza a probabilidade cumulativa, pelo que o número de candidatos aumenta quando o modelo está incerto e diminui quando um token domina. O min-p, por sua vez, define um limiar relativo ao token mais provável, adaptando o corte à confiança sem visar uma massa cumulativa fixa.

A investigação sobre a amostragem min-p relata melhor qualidade criativa e diversidade do que o top-p nas configurações de temperatura elevada testadas. O mecanismo é relevante localmente porque os modelos pequenos ou quantizados podem apresentar distribuições mais acentuadas ou mais ruidosas do que as predefinições assumidas por uma interface alojada.

Os filtros atuam antes da extração aleatória, enquanto as penalizações modificam as pontuações com base nos tokens anteriores. Combinar um truncamento agressivo com uma penalização de repetição forte pode deixar alternativas estranhas, fazendo com que o resultado pareça instável, embora cada definição parecesse conservadora isoladamente.

Onde mais aleatoriedade deixa de melhorar a naturalidade

A diversidade criativa e a precisão do raciocínio não evoluem em conjunto. Uma temperatura elevada pode produzir histórias variadas, mas prejudicar a aritmética, o código, a fidelidade das citações e o resultado estruturado. Por outro lado, a descodificação gulosa pode ser adequada para uma extração condicionada, embora soe rígida numa conversa.

A investigação sobre a amostragem seletiva conclui que escolhas com temperatura elevada podem degradar o raciocínio em posições de tokens sensíveis, o que justifica uma aleatoriedade seletiva em vez de uniforme. Uma única definição global não consegue otimizar todas as partes de todas as tarefas. Essa distinção altera a decisão doméstica resultante.

O limite de falha surge quando o resultado viola a restrição da tarefa: JSON inválido, afirmações sem suporte, código quebrado ou ciclos repetidos. A amostragem não pode corrigir um prompt fraco, contexto insuficiente, um modelo inadequado ou um histórico de conversa corrompido; apenas altera a seleção entre as probabilidades disponíveis.

-15% OFF

Crie uma grelha de testes de amostragem reproduzível

Escolha três prompts representativos: extração determinística, conversa normal e geração aberta. Mantenha fixos o ficheiro do modelo, a quantização, o prompt, o contexto e o número máximo de tokens. Execute cada um numa pequena grelha de temperaturas e com um método de truncamento, utilizando uma semente fixa e várias sementes aleatórias.

Registe os resultados inválidos, a repetição exata de frases, o rácio de tokens únicos, a precisão da tarefa e a latência. Isto isola a descodificação do problema de coerência descrito na coerência em contextos longos, em que um contexto de conversa extenso pode reduzir autonomamente a qualidade das respostas. Este limite continua visível durante a revisão posterior das evidências.

Selecione predefinições separadas por carga de trabalho, em vez de um valor universal. Rejeite uma predefinição se melhorar a variedade, mas falhar as restrições rígidas da tarefa, e volte a executar a grelha depois de alterar o modelo, a quantização, o modelo de prompt ou a penalização de repetição.

Centro de Tecnologia e IA

Mais para Ler

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.