Hur påverkar akustisk ekokancellering röstigenkänning på långt avstånd?

Eva Wong är Teknisk skribent och den boende fixaren på ZimaSpace. En livslång nörd med en passion för hemma-labb och öppen källkod, hon specialiserar sig på att översätta komplexa tekniska koncept till tillgängliga, praktiska guider. Eva tror att självhosting ska vara roligt, inte skrämmande. Genom sina handledningar ger hon gemenskapen verktyg att avmystifiera hårdvaruinstallationer, från att bygga sin första NAS till att bemästra Docker-containrar.

Akustisk ekokansellering förbättrar igenkänning på långt avstånd genom att uppskatta högtalaruppspelningen som fångas upp av mikrofonen och ta bort den innan taligenkänning.

En hemassistent som lyssnar tvärs över ett rum hör den boende tillsammans med sin egen musik, sitt talade svar och reflektioner från väggar och möbler. AEC tar emot den rena uppspelningsreferensen, modellerar hur rummet omvandlar den och subtraherar det förutsagda ekot från mikrofonljudet. Igenkänningen förbättras när modellen följer den verkliga ekovägen utan att skada tal nära mikrofonen.

Uppspelningsreferensen förutsäger vad som återvänder till mikrofonen

Systemet känner till den digitala signal som skickas till högtalaren. Ett adaptivt filter modellerar fördröjning, frekvensrespons och reflektioner mellan referensen och mikrofonen och skapar en uppskattning av ekot som finns inbäddat i den inspelade ljudmixen.

En detaljerad förklaring av modellering av ekovägen följer högtalarljudet genom rummets ytor och tillbaka in i mikrofonen och visar varför fördröjt eget ljud stör kommunikationen. Samma inspelade eko kan dominera igenkänningen på långt avstånd under lokal uppspelning. Denna skillnad förblir synlig under senare tester i hemmet.

Exakt justering är viktig eftersom subtraktion av rätt vågform vid fel tidpunkt lämnar kvar eko och kan ta bort orelaterat tal. Ändringar i uppspelningslatens måste inkluderas i modellen. Mellanresultatet måste förbli granskningsbart innan automatiseringen fortsätter.

Adaptiv filtrering och undertryckning av kvarvarande eko rensar mixen

Filtret uppdaterar koefficienterna när rummets ljudväg förändras, subtraherar det uppskattade linjära ekot och kan låta återstående komponenter passera genom en undertryckare för kvarvarande eko. Taligenkännaren får då ljud med ett starkare förhållande mellan tal nära mikrofonen och eko. Den gränsen bör mätas separat under realistiska driftförhållanden.

Forskning om flerkanalig adaptiv filtrering beskriver flerkanalig adaptiv filtrering som tar hänsyn till tal nära mikrofonen och brus. Mikrofonarrayer tillför flera ekovägar, vilket ökar både den tillgängliga rumsliga informationen och anpassningens komplexitet. Den praktiska konsekvensen blir tydlig när flera källor konkurrerar om ett begränsat sammanhang.

Flyttade möbler, högtalarvolym, enhetens rörelse och avvikelser mellan samplingsklockor kan göra det gamla filtret felaktigt. Konvergenshastigheten avgör hur länge igenkänningen förblir utsatt efter en förändring av ljudvägen. Detta beroende bör förbli explicit i det slutliga gränssnittet.

Dubbelprat skyddar den boendes röst från att kanselleras

När uppspelning och en boende förekommer samtidigt kan naiv anpassning behandla tal nära mikrofonen som ett fel i ekomodellen och förvränga det. Dubbelpratsdetektering pausar eller ändrar anpassningen samtidigt som den nya talaren bevaras så långt det är möjligt.

En studie av ekokontroll vid dubbelprat förklarar det utmanande fallet där uppspelning från andra änden och tal nära mikrofonen förekommer samtidigt. Undertryckningen av kvarvarande eko måste ta bort ekot utan att radera tal som taligenkännaren behöver. Resultatet måste därför kontrolleras mot originalunderlaget.

Felgränsen utgörs av icke-linjär uppspelningsförvrängning, kraftig efterklang, saknad referenssignal eller felaktig tidsinställning som överstiger modellens kapacitet. AEC kan då lämna artefakter som är värre än det ursprungliga ekot och försämra igenkänningen trots lägre uppmätt energinivå.

Mät igenkänningen före och efter ekobearbetning

Spela in fasta kommandon på flera avstånd under tystnad, musik, syntetiskt assistenttal, volymändringar, rörelser i rummet och dubbelprat. Spara referens, råmikrofonljud, förutsagt eko, kvarvarande signal, bearbetat ljud, transkriptioner och tidsinformation. Denna skillnad förblir synlig under senare tester i hemmet.

Jämför mönstret med ekobeteende i rummet. Mät förbättring av ekots returförlust, talförvrängning, ordfelets frekvens, väckningsprecision, konvergenstid och felaktiga avvisningar med samma taligenkännare och mikrofonplacering. Mellanresultatet måste förbli granskningsbart innan automatiseringen fortsätter.

Aktivera AEC endast när det bearbetade ljudet förbättrar kommandoigenkänningen i både uppspelnings- och dubbelpratsfall. Bevara diagnostik med förbikoppling och testa på nytt efter ändringar av högtalare, mikrofoner, samplingsfrekvenser eller rummets akustik. Den gränsen bör mätas separat under realistiska driftförhållanden.

Teknik- och AI-hubb

Mer att läsa

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.