Waarom onderbreekt een lokale stemassistent zichzelf in een galmende ruimte?

Eva Wong is de Technisch Schrijver en en vaste knutselaar bij ZimaSpace. Een levenslange geek met een passie voor homelabs en open-source software, zij is gespecialiseerd in het vertalen van complexe technische concepten naar toegankelijke, praktische handleidingen. Eva gelooft dat zelf-hosting leuk moet zijn, niet intimiderend. Met haar tutorials stelt ze de community in staat om hardware-setup te ontrafelen, van het bouwen van hun eerste NAS tot het beheersen van Docker-containers.

Een lokale spraakassistent kan zichzelf onderbreken wanneer afgespeelde audio na echo-onderdrukking hoorbaar blijft en ten onrechte wordt aangezien voor een wake word of een signaal dat een gebruiker ertussen spreekt.

De luidspreker en microfoons van de assistent bevinden zich in dezelfde ruimte, waardoor elke gesproken reactie via directe lekkage en vertraagde reflecties van muren, meubels en glas terugkomt. Akoestische echo-onderdrukking schat dat pad en trekt de afgespeelde audio af van het microfoonsignaal. Lange nagalm, bewegingen van het apparaat, niet-lineaire luidsprekers, volumewijzigingen en gelijktijdige menselijke spraak maken die schatting onvolledig en kunnen de onderbrekingslogica activeren.

Afgespeelde audio keert terug via een veranderend echopad

De microfoon vangt spraak aan de nabije kant op, plus het luidsprekersignaal van de assistent dat is vervormd door de impulsrespons van de ruimte. Een kort direct pad is gemakkelijker te modelleren dan honderden milliseconden aan uitdovende reflecties, vooral wanneer mensen of voorwerpen bewegen.

nagalmende afspeelecho verwijdert echo van tekst-naar-spraakweergave uit overlappende opnamen en modelleert expliciet nagalmende TTS die door de microfoon wordt opgevangen. De probleemformulering laat zien waarom de assistent weliswaar een schoon referentiesignaal heeft, maar toch een getransformeerde akoestische kopie ontvangt.

Een adaptief filter schat voortdurend het echopad van de afspeelreferentie naar de microfoon. Als het filter te kort is, zich te langzaam aanpast of tussen reacties wordt gereset, kan resterende spraak genoeg fonetische structuur behouden om op het wake word of een uiting waarbij de gebruiker ertussen spreekt te lijken.

Gelijktijdige spraak en niet-lineaire weergave beperken de onderdrukking

Tijdens gelijktijdige spraak praat iemand terwijl de assistent audio afspeelt. De echo-onderdrukker moet de menselijke stem behouden zonder zich daaraan aan te passen alsof die deel uitmaakt van het echopad; agressieve onderdrukking kan de gebruiker wegfilteren, terwijl zwakke onderdrukking zelfspraak laat doorkomen.

niet-lineaire resterende echo combineert een adaptief filter met een deep-learningnetwerk in meerdere fasen om resterende echo en niet-lineaire componenten te verwerken. De architectuur weerspiegelt dat lineaire aftrekking alleen vervorming van de luidspreker, clipping en ruimte-effecten niet onder alle omstandigheden kan modelleren.

Volumegerelateerde vervorming van de luidspreker is bijzonder problematisch, omdat de afspeelreferentie wordt vastgelegd voordat de versterker en transducer niet-lineariteiten toevoegen. Het verplaatsen van het apparaat, het afdekken van een microfoon of het wijzigen van de uitvoerrouting maakt een eerder geconvergeerd filter eveneens ongeldig.

Wake-word- en onderbrekingslogica zetten resterende echo om in een actie

Na echo-onderdrukking bepalen stemactiviteits- en wake-wordmodellen of iemand spreekt. Lage drempels verbeteren de reactiesnelheid, maar kunnen resterende lettergrepen, nagalmstaarten of artefacten van comfortgeluid interpreteren als bewijs om de weergave te stoppen en de herkenning opnieuw te openen.

gezamenlijke spraak- en echobewerking ontwikkelt gepersonaliseerde spraakverbetering in realtime met akoestische echo-onderdrukking binnen strikte rekenlimieten. Het onderzoek benadrukt dat doelspraak behouden moet blijven terwijl gelijktijdige weergave wordt onderdrukt, in plaats van het volledige gemengde interval als ruis te behandelen.

De foutieve aanname is dat een onderbreking bewijst dat de echo-onderdrukking slecht werkt. Een echte gebruiker, televisie, meldingsgeluid of netwerkvertraging bij een besturingsgebeurtenis kan de weergave ook stoppen. Leg resterende-echometingen, wake-confidence, stemactiviteit en de uiteindelijke onderbrekingsbeslissing vast op dezelfde klok.

Meet zelfonderbreking aan de hand van de afspeelreferentie

Speel vaste assistentzinnen af op verschillende volumes in een stille ruimte en voeg vervolgens een gebruiker toe die ertussen spreekt, televisiespraak en bewegingen van het apparaat. Test microfoonposities dichtbij en op afstand terwijl je de afspeelreferentie, ruwe microfoonsignalen, echo-onderdrukte audio, wakescores, stemactiviteit en onderbrekingstijdstempels opneemt.

Vergelijk de variabelen van de ruimte met beperkingen van spraak op afstand. Meet de verbetering van het echoretourverlies, het aantal foutieve onderbrekingen per uur, gemiste echte momenten waarop een gebruiker ertussen spreekt en de hersteltijd nadat het echopad verandert, in plaats van alleen te beoordelen hoe schoon opnamen klinken.

Stel de onderbrekingsdrempel pas af nadat de echo-onderdrukker in representatieve ruimtes en bij representatieve volumes is geconvergeerd. Als het onderdrukken van zelfecho ook echte gebruikers verwijdert, vereist dan een langer bevestigingsvenster of directionele informatie, in plaats van uitsluitend de onderdrukking of reactiesnelheid te maximaliseren.

Tech & AI HUB

Meer om te lezen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.