Dlaczego silnik słowa wybudzającego traktuje echo w pomieszczeniu jak drugie polecenie?

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Silnik wykrywania słowa aktywującego może potraktować echo w pomieszczeniu jako drugie polecenie, gdy dźwięk z własnego głośnika wraca do mikrofonu po niepełnym usunięciu echa.

Asystent odtwarza mowę w pomieszczeniu, a ściany, blaty i meble tworzą w mikrofonie opóźnione, przefiltrowane kopie. Akustyczne usuwanie echa odejmuje oszacowaną ścieżkę na podstawie znanego sygnału odtwarzania, ale ruch, nieliniowość głośników, przesterowanie i długi pogłos pozostawiają energię resztkową. Jeśli wykrywanie słowa aktywującego lub aktywność głosowa zostaną ponownie uruchomione zbyt wcześnie, ta pozostałość może przypominać kolejną wypowiedź.

Pomieszczenie zamienia odtwarzany dźwięk w opóźniony sygnał mikrofonu

Sygnał z głośnika dociera do mikrofonu bezpośrednio oraz przez liczne odbicia. Powstała odpowiedź impulsowa pomieszczenia rozciąga sylaby w czasie, dlatego dźwięk asystenta może pozostać w mikrofonie po tym, jak odtwarzanie pozornie się zakończyło.

Przegląd akustycznego usuwania echa opisuje filtry adaptacyjne, które szacują ścieżkę echa i odejmują przewidywany sygnał odtwarzania od nagrania z mikrofonu. Filtr musi śledzić zmiany w pomieszczeniu i położeniu urządzenia, zamiast usuwać stałą, zduplikowaną falę.

Większa głośność głośnika, mała odległość między głośnikiem a mikrofonem, powierzchnie odbijające oraz duże wzmocnienie mikrofonu zwiększają stosunek echa do mowy z bliskiego źródła. Ogony pogłosu mogą również przekraczać granice końca polecenia dostrojone w cichszym pomieszczeniu. To rozróżnienie pozostaje widoczne podczas późniejszych testów domowych.

Usuwanie echa pozostawia składowe resztkowe podczas zmian ścieżki i mowy jednoczesnej

Model AEC opiera się na czystym sygnale odniesienia odtwarzania i wystarczająco dokładnym oszacowaniu liniowej ścieżki. Zniekształcenia głośnika, automatyczne zmiany wzmocnienia, utracone ramki sygnału odniesienia lub poruszająca się osoba zmieniają przechwytywany przebieg szybciej, niż filtr może się dostosować.

Badania nad obsługą echa podczas jednoczesnej mowy łączą modelowanie ścieżki echa z obsługą jednoczesnej mowy, pokazując, dlaczego usuwanie echa musi odróżniać lokalną mowę od zwracanego odtwarzania. Zbyt agresywna adaptacja może usunąć głos użytkownika, a zachowawcza adaptacja pozostawia więcej echa. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim automatyzacja zacznie na nim polegać.

Neuralne tłumienie składowych resztkowych może ograniczyć to, czego nie usuwa filtr adaptacyjny, ale może zniekształcać fonemy słowa aktywującego lub zawodzić w nieznanych pomieszczeniach. Model słowa aktywującego otrzymuje wtedy przetworzoną składową resztkową, której charakterystyka widmowa może być bardziej zbliżona do mowy niż surowe echo.

Synchronizacja stanów zamienia mowę resztkową w nową interakcję

Potok głosowy przełącza się między nasłuchem bezczynności, wykrywaniem słowa aktywującego, przechwytywaniem polecenia, odtwarzaniem odpowiedzi i wstrzymaniem po odtwarzaniu. Jeśli wykrywanie słowa aktywującego działa podczas odtwarzania albo wstrzymanie kończy się przed ogonem pogłosu, silnik może natychmiast ponownie się otworzyć.

Wielostopniowy model tłumienia echa resztkowego rozdziela usuwanie liniowe i tłumienie echa resztkowego, pokazując, że kontrola echa jest łańcuchem, a nie pojedynczym filtrem binarnym. Logika stanów musi uwzględniać pozostałą niepewność. Tę granicę należy mierzyć osobno w realistycznych warunkach pracy.

Granica błędu polega na uznawaniu każdej drugiej aktywacji za echo. Mowa z telewizora, inna osoba, artefakty ultradźwiękowe lub aplikacja odtwarzająca buforowany dźwięk mogą generować ten sam wpis w dzienniku. Należy potwierdzić, że wykryty segment koreluje z sygnałem odniesienia odtwarzania urządzenia.

-15% OFF

Odtwórz ścieżkę echa przez pełną maszynę stanów głosowych

Rejestruj zsynchronizowany sygnał odniesienia odtwarzania, surowy sygnał mikrofonu, wyjście AEC, wyjście tłumienia składowych resztkowych, wynik słowa aktywującego, stan aktywności głosowej, granice poleceń i głośność głośnika w warunkach cichych, odbijających dźwięk, z ruchem oraz podczas jednoczesnej mowy. Zachowaj zegary audio, aby oszacowania opóźnienia pozostały miarodajne. Praktyczne konsekwencje pojawiają się, gdy kilka źródeł konkuruje o ograniczony kontekst.

Wykorzystaj działanie potoku słowa aktywującego, aby oddzielić koszt wykrywania słowa aktywującego od zachowania echa. Powtórz test przy wyciszonym odtwarzaniu, pominiętym usuwaniu echa i kilku czasach wstrzymania po odtwarzaniu, zachowując ten sam przebieg odpowiedzi i geometrię pomieszczenia. Ta zależność powinna pozostać jawna w końcowym interfejsie.

Test przechodzi, gdy prawdziwe polecenia z bliskiego źródła pozostają wykrywalne, ale składowe resztkowe skorelowane z odtwarzaniem nie mogą uruchomić drugiego polecenia. Najpierw popraw wyrównanie sygnału odniesienia lub zbieżność AEC, zamiast jedynie podnosić próg słowa aktywującego, ponieważ może to ukryć echo, jednocześnie odrzucając cichych użytkowników.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.