Um assistente de voz local pode interromper-se quando a reprodução refletida persiste após o cancelamento de eco e é confundida com uma palavra de ativação ou um sinal de interrupção humana.
O altifalante e os microfones do assistente partilham a mesma divisão, pelo que cada resposta falada regressa através de fuga direta e reflexões retardadas nas paredes, no mobiliário e no vidro. O cancelamento de eco acústico estima esse percurso e subtrai a reprodução do fluxo do microfone. A reverberação prolongada, o movimento do dispositivo, os altifalantes não lineares, as alterações de volume e a fala humana simultânea tornam a estimativa incompleta e podem acionar a lógica de interrupção.
A reprodução regressa através de um percurso de eco variável no tempo
O microfone capta a fala próxima, além do sinal do altifalante do assistente convoluído com a resposta impulsional da divisão. Um percurso direto curto é mais fácil de modelar do que centenas de milissegundos de reflexões decrescentes, sobretudo quando pessoas ou objetos se movem.
eco de reprodução reverberado remove o eco da reprodução de texto para fala de gravações sobrepostas e modela explicitamente o TTS reverberado captado pelo microfone. A formulação do problema mostra por que razão o assistente tem um sinal de referência limpo, mas continua a receber uma cópia acústica transformada.
Um filtro adaptativo estima continuamente o percurso do eco desde a referência de reprodução até ao microfone. Se o filtro for demasiado curto, se adaptar demasiado lentamente ou for reiniciado entre respostas, o discurso residual pode manter estrutura fonética suficiente para se assemelhar à palavra de ativação ou a uma expressão de interrupção.
A fala simultânea e a reprodução não linear limitam o cancelamento
Durante a fala simultânea, uma pessoa fala enquanto o assistente reproduz áudio. O cancelador tem de preservar a voz humana sem se adaptar a ela como se fizesse parte do percurso do eco; uma supressão agressiva pode apagar a voz do utilizador, enquanto uma supressão fraca deixa passar a própria fala.
eco residual não linear combina um filtro adaptativo com uma rede profunda em várias etapas para lidar com o eco residual e os componentes não lineares. A arquitetura reflete o facto de a subtração linear, por si só, não conseguir modelar a distorção do altifalante, o clipping e os efeitos da divisão em todas as condições.
A distorção do altifalante dependente do volume é especialmente problemática, porque a referência de reprodução é captada antes de o amplificador e o transdutor acrescentarem não linearidades. Mover o dispositivo, tapar um microfone ou alterar o encaminhamento da saída também invalida um filtro que tenha convergido anteriormente.
A lógica da palavra de ativação e da interrupção transforma o eco residual numa ação
Após a supressão do eco, os modelos de atividade vocal e de palavras de ativação decidem se uma pessoa está a falar. Limiares baixos melhoram a capacidade de resposta, mas podem interpretar sílabas residuais, caudas reverberantes ou artefactos de ruído de conforto como indícios para parar a reprodução e reabrir o reconhecimento.
processamento conjunto da fala e do eco desenvolve uma melhoria da fala personalizada em tempo real com cancelamento de eco acústico sob limites rigorosos de computação. O trabalho realça a necessidade de preservar a fala pretendida enquanto se suprime a reprodução simultânea, em vez de tratar todo o intervalo misto como ruído.
O erro está em assumir que uma interrupção prova um cancelamento de eco deficiente. Um utilizador real, a televisão, um som de notificação ou um evento de controlo atrasado pela rede também podem parar a reprodução. Registe as métricas de eco residual, a confiança da palavra de ativação, a atividade vocal e a decisão final de interrupção no mesmo relógio.
Meça a auto-interrupção em relação à referência de reprodução
Reproduza frases fixas do assistente a vários volumes numa divisão silenciosa e, em seguida, adicione uma interrupção humana, fala televisiva e movimento do dispositivo. Teste posições de microfone próximas e afastadas, enquanto grava a referência de reprodução, os microfones em bruto, o áudio com eco cancelado, as pontuações da palavra de ativação, a atividade vocal e os carimbos temporais das interrupções.
Compare as variáveis da divisão com os limites da voz em campo distante. Meça o aumento da perda de retorno do eco, as interrupções falsas por hora, as interrupções reais não detetadas e o tempo de recuperação após a alteração do percurso do eco, em vez de avaliar apenas o quão limpas parecem as gravações.
Ajuste o limiar de interrupção apenas depois de o cancelador convergir em divisões e volumes representativos. Se a supressão do autoeco também remover utilizadores reais, exija uma janela de confirmação mais longa ou evidências direcionais, em vez de maximizar apenas o cancelamento ou a capacidade de resposta.
Centro de Tecnologia e IA
Mais para Ler

Porque é que o consumo de energia da GPU aumenta bruscamente no início de um pedido de inferência local?
Veja como o aumento da frequência da GPU, o prefill do modelo, a inicialização do kernel, a alocação de memória e os intervalos de...

Porque é que a classificação da pesquisa vetorial muda quando são consultados vários segmentos de índice em conjunto?
Saiba como os limites de candidatos por segmento, os grafos aproximados, a calibração de pontuações, as atualizações e a consolidação alteram a classificação da...

Porque é que os grupos de deduplicação de fotografias se dividem depois de os metadados serem editados?
Veja como os hashes exatos, os hashes percetivos, a orientação EXIF, os carimbos de data e hora, os limiares e as versões do pipeline...

