Akustyczna eliminacja echa poprawia rozpoznawanie z dużej odległości, szacując dźwięk odtwarzany przez głośnik i przechwytywany przez mikrofon, a następnie usuwając go przed rozpoznawaniem mowy.
Asystent domowy słuchający z drugiego końca pomieszczenia rejestruje mieszkańca oraz własną muzykę, wypowiadaną odpowiedź i odbicia od ścian i mebli. AEC otrzymuje czysty sygnał odniesienia odtwarzania, modeluje sposób, w jaki pomieszczenie go modyfikuje, i odejmuje przewidywane echo od dźwięku z mikrofonu. Rozpoznawanie poprawia się, gdy model śledzi rzeczywistą ścieżkę echa bez uszkadzania mowy z bliskiego pola.
Sygnał odniesienia odtwarzania przewiduje, co wraca do mikrofonu
System zna sygnał cyfrowy wysyłany do głośnika. Filtr adaptacyjny modeluje opóźnienie, charakterystykę częstotliwościową i odbicia między tym sygnałem odniesienia a mikrofonem, tworząc oszacowanie echa zawartego w przechwyconej mieszaninie.
Szczegółowe wyjaśnienie modelowania ścieżki echa pokazuje drogę dźwięku z głośnika przez powierzchnie pomieszczenia z powrotem do mikrofonu i wyjaśnia, dlaczego opóźniony dźwięk własny zakłóca komunikację. To samo przechwycone echo może dominować w rozpoznawaniu z dużej odległości podczas lokalnego odtwarzania. Rozróżnienie to pozostaje widoczne podczas późniejszych testów w domu.
Dokładne wyrównanie ma znaczenie, ponieważ odejmowanie właściwego przebiegu w niewłaściwym czasie pozostawia echo resztkowe i może usuwać niezwiązaną z nim mowę. Zmiany opóźnienia odtwarzania muszą być uwzględnione w modelu. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim zostanie zastosowana automatyzacja.
Filtrowanie adaptacyjne i tłumienie resztkowe oczyszczają mieszaninę
Filtr aktualizuje współczynniki wraz ze zmianami ścieżki w pomieszczeniu, odejmuje oszacowane echo liniowe i może przepuszczać pozostałe składniki przez tłumik resztkowy. Następnie do systemu rozpoznawania trafia dźwięk z wyższym stosunkiem sygnału mowy z bliskiego pola do echa. Tę granicę należy mierzyć osobno w realistycznych warunkach pracy.
Badania nad wielokanałowym filtrowaniem adaptacyjnym opisują wielokanałowe filtrowanie adaptacyjne uwzględniające mowę z bliskiego pola i hałas. Macierze mikrofonów dodają kilka ścieżek echa, zwiększając zarówno dostępną informację przestrzenną, jak i złożoność adaptacji. Praktyczne skutki są widoczne, gdy kilka źródeł konkuruje o ograniczony kontekst.
Przemieszczanie mebli, głośność głośnika, ruch urządzenia i rozbieżność zegarów próbkowania mogą sprawić, że stary filtr stanie się niedokładny. Szybkość zbieżności określa, jak długo rozpoznawanie pozostaje narażone po zmianie ścieżki. Ta zależność powinna pozostać wyraźnie przedstawiona w końcowym interfejsie.
Detekcja mowy podwójnej chroni głos mieszkańca przed anulowaniem
Gdy odtwarzanie i głos mieszkańca występują jednocześnie, naiwna adaptacja może potraktować mowę z bliskiego pola jako błąd modelu echa i ją zniekształcić. Detekcja mowy podwójnej wstrzymuje lub modyfikuje adaptację, zachowując w miarę możliwości głos nowego rozmówcy.
Badanie dotyczące kontroli echa przy mowie podwójnej wyjaśnia trudny przypadek, w którym współistnieją odtwarzanie z dalekiego pola i mowa z bliskiego pola. Tłumienie resztkowe musi usuwać echo bez wymazywania mowy potrzebnej systemowi rozpoznawania. Wynik należy zatem sprawdzać względem pierwotnych danych.
Granica niepowodzenia pojawia się przy nieliniowych zniekształceniach odtwarzania, silnym pogłosie, braku sygnału odniesienia lub nieprawidłowym taktowaniu wykraczającym poza możliwości modelu. AEC może wtedy pozostawić artefakty gorsze niż pierwotne echo i zmniejszyć skuteczność rozpoznawania mimo niższej zmierzonej energii.
Zmierz rozpoznawanie przed i po przetwarzaniu echa
Nagrywaj ustalone polecenia z kilku odległości podczas ciszy, odtwarzania muzyki, syntetycznej mowy asystenta, zmian głośności, poruszania się po pomieszczeniu i mowy podwójnej. Zapisuj sygnał odniesienia, surowy dźwięk z mikrofonu, przewidywane echo, sygnał resztkowy, przetworzony dźwięk, transkrypcje i czasy. Rozróżnienie to pozostaje widoczne podczas późniejszych testów w domu.
Porównaj ten wzorzec z zachowaniem echa w pomieszczeniu. Zmierz poprawę tłumienia echa powrotnego, zniekształcenia mowy, współczynnik błędów słów, skuteczność wykrywania słowa aktywującego, czas zbieżności i odrzucenia fałszywe, używając tego samego systemu rozpoznawania i tego samego rozmieszczenia mikrofonów. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim zostanie zastosowana automatyzacja.
Włącz AEC tylko wtedy, gdy przetworzony dźwięk poprawia dokładność poleceń w przypadkach odtwarzania i mowy podwójnej. Zachowaj diagnostykę obejścia i powtórz testy po zmianie głośników, mikrofonów, częstotliwości próbkowania lub akustyki pomieszczenia. Tę granicę należy mierzyć osobno w realistycznych warunkach pracy.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Czym jest dryf osadzeń i kiedy prywatny indeks wyszukiwania wymaga przebudowy?
Odkoduj dryf modelu, przetwarzania wstępnego, korpusu i zapytań; odróżnij monitorowanie od niezgodności oraz zdecyduj, kiedy prywatny indeks wymaga przebudowy.

Czym jest zgodność tokenizera i dlaczego może zakłócić przełączanie modeli?
Odkryj tożsamość słownictwa, znaczenie tokenów specjalnych, szablony czatu, buforowane tokeny, adaptery i kontrole zgodności przy lokalnym przełączaniu modeli.

Czym jest rezydencja modelu i kiedy lokalna usługa AI powinna przechowywać wagi w pamięci?
Poznaj rezydencję wag, poziomy pamięci podręcznej, zimne uruchomienia, eksmisję, multipleksowanie, presję pamięci oraz dowiedz się, kiedy domowa usługa AI powinna pozostać aktywna.

