Porque é que um assistente de voz local se interrompe numa sala reverberante?

Eva Wong é a Redatora Técnica e e entusiasta residente na ZimaSpace. Uma geek de longa data com paixão por homelabs e software de código aberto, ela é especialista em traduzir conceitos técnicos complexos em guias acessíveis e práticos . Eva acredita que o auto-hospedagem deve ser divertida, não intimidante. Através dos seus tutoriais, ela capacita a comunidade adesmistificar configurações de hardware , desde a construção do seu primeiro NAS até dominar os contêineres Docker., from building their first NAS to mastering Docker containers.

Um assistente de voz local pode interromper-se quando a reprodução refletida persiste após o cancelamento de eco e é confundida com uma palavra de ativação ou um sinal de interrupção humana.

O altifalante e os microfones do assistente partilham a mesma divisão, pelo que cada resposta falada regressa através de fuga direta e reflexões retardadas nas paredes, no mobiliário e no vidro. O cancelamento de eco acústico estima esse percurso e subtrai a reprodução do fluxo do microfone. A reverberação prolongada, o movimento do dispositivo, os altifalantes não lineares, as alterações de volume e a fala humana simultânea tornam a estimativa incompleta e podem acionar a lógica de interrupção.

A reprodução regressa através de um percurso de eco variável no tempo

O microfone capta a fala próxima, além do sinal do altifalante do assistente convoluído com a resposta impulsional da divisão. Um percurso direto curto é mais fácil de modelar do que centenas de milissegundos de reflexões decrescentes, sobretudo quando pessoas ou objetos se movem.

eco de reprodução reverberado remove o eco da reprodução de texto para fala de gravações sobrepostas e modela explicitamente o TTS reverberado captado pelo microfone. A formulação do problema mostra por que razão o assistente tem um sinal de referência limpo, mas continua a receber uma cópia acústica transformada.

Um filtro adaptativo estima continuamente o percurso do eco desde a referência de reprodução até ao microfone. Se o filtro for demasiado curto, se adaptar demasiado lentamente ou for reiniciado entre respostas, o discurso residual pode manter estrutura fonética suficiente para se assemelhar à palavra de ativação ou a uma expressão de interrupção.

A fala simultânea e a reprodução não linear limitam o cancelamento

Durante a fala simultânea, uma pessoa fala enquanto o assistente reproduz áudio. O cancelador tem de preservar a voz humana sem se adaptar a ela como se fizesse parte do percurso do eco; uma supressão agressiva pode apagar a voz do utilizador, enquanto uma supressão fraca deixa passar a própria fala.

eco residual não linear combina um filtro adaptativo com uma rede profunda em várias etapas para lidar com o eco residual e os componentes não lineares. A arquitetura reflete o facto de a subtração linear, por si só, não conseguir modelar a distorção do altifalante, o clipping e os efeitos da divisão em todas as condições.

A distorção do altifalante dependente do volume é especialmente problemática, porque a referência de reprodução é captada antes de o amplificador e o transdutor acrescentarem não linearidades. Mover o dispositivo, tapar um microfone ou alterar o encaminhamento da saída também invalida um filtro que tenha convergido anteriormente.

A lógica da palavra de ativação e da interrupção transforma o eco residual numa ação

Após a supressão do eco, os modelos de atividade vocal e de palavras de ativação decidem se uma pessoa está a falar. Limiares baixos melhoram a capacidade de resposta, mas podem interpretar sílabas residuais, caudas reverberantes ou artefactos de ruído de conforto como indícios para parar a reprodução e reabrir o reconhecimento.

processamento conjunto da fala e do eco desenvolve uma melhoria da fala personalizada em tempo real com cancelamento de eco acústico sob limites rigorosos de computação. O trabalho realça a necessidade de preservar a fala pretendida enquanto se suprime a reprodução simultânea, em vez de tratar todo o intervalo misto como ruído.

O erro está em assumir que uma interrupção prova um cancelamento de eco deficiente. Um utilizador real, a televisão, um som de notificação ou um evento de controlo atrasado pela rede também podem parar a reprodução. Registe as métricas de eco residual, a confiança da palavra de ativação, a atividade vocal e a decisão final de interrupção no mesmo relógio.

Meça a auto-interrupção em relação à referência de reprodução

Reproduza frases fixas do assistente a vários volumes numa divisão silenciosa e, em seguida, adicione uma interrupção humana, fala televisiva e movimento do dispositivo. Teste posições de microfone próximas e afastadas, enquanto grava a referência de reprodução, os microfones em bruto, o áudio com eco cancelado, as pontuações da palavra de ativação, a atividade vocal e os carimbos temporais das interrupções.

Compare as variáveis da divisão com os limites da voz em campo distante. Meça o aumento da perda de retorno do eco, as interrupções falsas por hora, as interrupções reais não detetadas e o tempo de recuperação após a alteração do percurso do eco, em vez de avaliar apenas o quão limpas parecem as gravações.

Ajuste o limiar de interrupção apenas depois de o cancelador convergir em divisões e volumes representativos. Se a supressão do autoeco também remover utilizadores reais, exija uma janela de confirmação mais longa ou evidências direcionais, em vez de maximizar apenas o cancelamento ou a capacidade de resposta.

Centro de Tecnologia e IA

Mais para Ler

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.