A transcrição local pode inserir palavras durante o silêncio porque o descodificador tem de resolver evidências acústicas fracas usando padrões linguísticos aprendidos e contexto herdado.
Uma gravação doméstica supostamente silenciosa ainda contém ruído próprio do microfone, ventoinhas, zumbido da sala, artefactos de compressão e caudas reverberantes. Se o pipeline enviar esse segmento para um reconhecedor autorregressivo, o modelo recebe características, não uma instrução explícita para não produzir nada. O texto anterior, a seleção do idioma, os limiares de descodificação e os limites dos blocos podem transformar sons incertos em frases plausíveis.
O silêncio produz características mesmo sem fala
O silêncio digital pode ser composto por zeros, mas o silêncio real captado contém energia de baixo nível e ruído estruturado. A extração de características converte esse espetro em tramas que podem parecer padrões fonéticos fracos, sobretudo depois de o controlo automático de ganho elevar o nível de ruído ou de um codec criar artefactos periódicos.
Uma investigação sobre alucinações com sons não falados expõe deliberadamente o Whisper a sons não falados e encontra frases alucinadas recorrentes. A repetição indica que a acústica ambígua interage com padrões de saída aprendidos, em vez de produzir caracteres arbitrários. Esta distinção continua visível durante os testes domésticos posteriores.
Um detetor de atividade vocal pode bloquear regiões claramente sem fala antes da descodificação, mas os seus próprios falsos positivos aumentam com áudio de televisão, música, respiração e eletrodomésticos. A deteção de silêncio e a transcrição são classificadores separados, com limiares e modos de falha distintos.
A descodificação autorregressiva preenche a incerteza acústica com priors linguísticos
Os descodificadores de fala atribuem pontuações ao texto com base tanto nas evidências acústicas como na probabilidade aprendida das sequências. Quando o termo acústico é fraco, frases comuns, pontuação, convenções de legendagem ou texto fornecido como prompt anterior podem dominar a decisão sobre o token seguinte.
Um estudo sobre ASR com supervisão fraca descreve o reconhecimento de fala com supervisão fraca em grande escala, abrangendo dados e tarefas variados. Essa amplitude proporciona fortes regularidades linguísticas, mas também significa que a descodificação pode continuar com texto plausível quando um segmento local fornece poucas evidências de fala.
Janelas longas podem incluir algumas palavras reais seguidas de silêncio, permitindo que o modelo prolongue o padrão. Janelas curtas podem remover o contexto necessário para rejeitar ruído. A sobreposição dos blocos, a transferência do prompt, o fallback de temperatura e os limiares de ausência de fala influenciam, por isso, o tipo de falha que ocorre.
O pós-processamento pode ocultar a frequência, mas não estabelecer a verdade
Uma lista negra pode remover frases que se repetem durante o silêncio, e os filtros de confiança podem suprimir segmentos de baixa probabilidade. Estas salvaguardas reduzem os erros visíveis, mas também podem eliminar fala genuína e baixa que contenha as mesmas palavras. O resultado intermédio deve continuar a ser inspecionável antes de qualquer automatização.
Um estudo sobre frases transcritas sem suporte relata frases completas inventadas e salienta que uma saída fluente pode parecer credível mesmo quando não é sustentada pelo áudio. A lição operacional é conservar as marcas temporais e as evidências acústicas para verificação, em vez de confiar na gramaticalidade.
O limite da falha consiste em chamar alucinação a todas as palavras produzidas sobre uma forma de onda silenciosa. Fala distante, fuga de som dos auscultadores, interferência ultrassónica dobrada para a banda ou supressão agressiva de ruído podem tornar a fala difícil de ouvir, mas ainda assim presente. Inspecione o áudio bruto e os níveis sincronizados antes de atribuir a falha ao modelo.
Crie um conjunto de desafios de silêncio antes de alterar os limiares
Grave silêncio digital verdadeiro, ruído ambiente, ventoinhas, AVAC, ruído de teclado, som de televisão, música, respiração e fala real baixa com vários ganhos. Preserve o áudio bruto e execute blocos idênticos com e sem controlo de atividade vocal, transferência do prompt e fallback de temperatura.
Meça as palavras falsas por minuto de silêncio juntamente com a fala baixa perdida, usando o mecanismo de controlo descrito em controlo da atividade vocal. Armazene a probabilidade de ausência de fala, a decisão do VAD, a energia média, a confiança do descodificador, a seleção do idioma, o limite do bloco e os tokens emitidos para cada falha.
Defina os limiares de modo a reduzir as inserções durante o silêncio sem perdas inaceitáveis de fala baixa. Para notas importantes, conserve as marcas temporais e a revisão do áudio; se uma frase recorrente sobreviver a vários controlos, trate-a como um artefacto do descodificador, não como prova de que ocorreu fala.
Centro de Tecnologia e IA
Mais para Ler

Como afeta a redução da frequência de amostragem de séries temporais a deteção de anomalias em casas inteligentes?
Veja como a largura dos intervalos, a agregação, o anti-aliasing, os dados em falta, a duração dos eventos e a retenção multiescala alteram a...

Como é que uma grelha de ocupação combina sinais fracos de uma casa inteligente?
Saiba como células espaciais, modelos de sensores, atualizações de log-odds, decaimento, evidências correlacionadas e limiares transformam sinais domésticos fracos em estimativas de ocupação.

Como é que a normalização fotométrica afeta o agrupamento privado de rostos?
Veja como a correção da iluminação altera recortes faciais, embeddings, distâncias entre clusters, limiares, sobre-normalização e a avaliação da pesquisa privada de fotografias.

