Um motor de deteção de palavra de ativação pode interpretar os ecos da divisão como um segundo comando quando o som emitido pelo próprio altifalante regressa ao microfone após um cancelamento incompleto.
O assistente reproduz fala numa divisão, e as paredes, bancadas e móveis criam cópias atrasadas e filtradas no microfone. O cancelamento de eco acústico subtrai um percurso estimado utilizando o sinal de reprodução conhecido, mas o movimento, os altifalantes não lineares, o clipping e a reverberação prolongada deixam energia residual. Se a deteção da palavra de ativação ou a atividade de voz for reaberta demasiado cedo, esse residual pode assemelhar-se a outra emissão.
A divisão converte a reprodução num sinal de microfone atrasado
O sinal do altifalante chega ao microfone diretamente e através de várias reflexões. A resposta impulsional da divisão resultante prolonga as sílabas ao longo do tempo, pelo que o áudio do assistente pode continuar presente no microfone depois de a reprodução parecer ter terminado.
Um estudo sobre cancelamento de eco acústico descreve filtros adaptativos que estimam o percurso do eco e subtraem a reprodução prevista da captação do microfone. O filtro tem de acompanhar as alterações na divisão e na posição dos dispositivos, em vez de remover uma forma de onda duplicada fixa.
Um volume superior do altifalante, uma distância curta entre o altifalante e o microfone, superfícies refletoras e um ganho elevado do microfone aumentam a relação entre o eco e a fala próxima. As caudas reverberantes também podem ultrapassar os limites de fim do comando ajustados numa divisão mais silenciosa. Esta distinção continua visível durante os testes domésticos posteriores.
O cancelamento de eco deixa residuais durante alterações do percurso e fala simultânea
Um modelo AEC depende de uma referência de reprodução limpa e de uma estimativa suficientemente precisa do percurso linear. A distorção do altifalante, as alterações automáticas de ganho, a perda de tramas de referência ou uma pessoa em movimento alteram a forma de onda captada mais depressa do que o filtro consegue convergir.
A investigação sobre processamento de eco durante fala simultânea combina a modelação do percurso do eco com o tratamento da fala simultânea, ilustrando por que razão o cancelamento tem de distinguir a fala local da reprodução devolvida. Uma adaptação demasiado agressiva pode remover a voz do utilizador; uma adaptação conservadora deixa mais eco. O resultado intermédio deve continuar a ser inspecionável antes de a automatização avançar.
A supressão neural de residuais pode reduzir o que o filtro adaptativo não consegue eliminar, mas pode distorcer os fonemas da palavra de ativação ou falhar em divisões desconhecidas. O modelo da palavra de ativação recebe então um residual processado cuja forma espectral pode estar mais próxima da fala do que do eco bruto.
A temporização do estado transforma a fala residual numa nova interação
Um pipeline de voz alterna entre a escuta inativa, a deteção da palavra de ativação, a captura do comando, a reprodução da resposta e o período de espera após a reprodução. Se a deteção da palavra de ativação funcionar durante a reprodução ou se o período de espera terminar antes da cauda reverberante, o motor pode reabrir imediatamente.
Um modelo de supressão de eco residual em várias etapas separa o cancelamento linear da supressão de eco residual, mostrando que o controlo do eco é uma cadeia e não um único filtro binário. A lógica de estados tem de consumir a incerteza restante. Esse limite deve ser medido separadamente em condições de funcionamento realistas.
O limite da falha consiste em chamar eco a todas as ativações subsequentes. A fala da televisão, outra pessoa, artefactos ultrassónicos ou uma aplicação que reproduza áudio armazenado em buffer podem produzir o mesmo registo. Confirme que o segmento detetado está correlacionado com a referência de reprodução do dispositivo.
Reproduza o percurso do eco através da máquina de estados de voz completa
Capte a referência de reprodução sincronizada, o áudio bruto do microfone, a saída do AEC, a saída da supressão de residuais, a pontuação da palavra de ativação, o estado da atividade de voz, os limites do comando e o volume do altifalante em condições silenciosas, refletoras, com movimento e de fala simultânea. Preserve os relógios de áudio para que as estimativas de atraso continuem a ser relevantes. A consequência prática surge quando várias fontes competem por um contexto limitado.
Utilize o comportamento do pipeline da palavra de ativação para separar o custo da deteção da palavra de ativação do comportamento do eco. Repita com a reprodução silenciada, o cancelamento contornado e vários períodos de espera após a reprodução, mantendo a mesma forma de onda de resposta e a mesma geometria da divisão. Esta dependência deve permanecer explícita na interface final.
O teste é aprovado quando os comandos próximos genuínos continuam detetáveis, mas os residuais correlacionados com a reprodução não conseguem iniciar um segundo comando. Corrija o alinhamento da referência ou a convergência do AEC antes de simplesmente aumentar o limiar da palavra de ativação, pois isso pode ocultar os ecos ao rejeitar também utilizadores com voz baixa.
Centro de Tecnologia e IA
Mais para Ler

Porque é que as alterações de ficheiros SMB chegam a um indexador incremental em rajadas?
Veja como o armazenamento em cache de escrita SMB, as concessões, CHANGE_NOTIFY, o transbordamento do buffer, a reconexão e o processamento em lotes do...

Porque é que o OCR não deteta texto ténue depois de um PDF ser recomprimido?
Saiba como a recompressão de PDF altera pixels ténues, por que razão os visualizadores podem ocultar essa perda e como testar a resolução, o...

Porque é que a latência da IA local oscila com a curva da ventoinha de um servidor doméstico?
Veja como o calor, o controlo da ventoinha, os limites do relógio, o atraso dos sensores e o timing da carga de trabalho criam...

