Lokalny asystent głosowy może sam się przerwać, gdy odbite odtwarzanie przetrwa usuwanie echa i zostanie pomylone ze słowem wybudzającym lub sygnałem wejścia użytkownika.
Głośnik i mikrofony asystenta znajdują się w tym samym pomieszczeniu, więc każda wypowiadana odpowiedź wraca przez bezpośrednie przesłuchy oraz opóźnione odbicia od ścian, mebli i szyb. Usuwanie echa akustycznego szacuje tę drogę i odejmuje odtwarzany dźwięk od strumienia z mikrofonu. Długi pogłos, przemieszczanie urządzenia, nieliniowość głośników, zmiany głośności i jednoczesna mowa człowieka sprawiają, że oszacowanie jest niepełne i mogą uruchomić logikę przerywania.
Odtwarzanie wraca zmienną w czasie drogą echa
Mikrofon rejestruje mowę z bliskiego końca oraz sygnał głośnika asystenta sploturowany z odpowiedzią impulsową pomieszczenia. Krótką drogę bezpośrednią łatwiej zamodelować niż setki milisekund wygasających odbić, zwłaszcza gdy przemieszczają się ludzie lub przedmioty.
echo odtwarzania z pogłosem usuwa echo odtwarzania zamiany tekstu na mowę z nakładających się nagrań i jawnie modeluje pogłos TTS rejestrowany przez mikrofon. Sformułowanie problemu pokazuje, dlaczego asystent ma czysty sygnał referencyjny, a mimo to odbiera przekształconą kopię akustyczną.
Filtr adaptacyjny stale szacuje drogę echa od sygnału referencyjnego odtwarzania do mikrofonu. Jeśli filtr jest zbyt krótki, dostosowuje się zbyt wolno lub resetuje się między odpowiedziami, pozostałości mowy mogą zachować wystarczająco dużo struktury fonetycznej, by przypominać słowo wybudzające lub wypowiedź wejścia użytkownika.
Rozmowa dwóch osób i nieliniowe odtwarzanie ograniczają skuteczność usuwania echa
Podczas rozmowy dwóch osób człowiek mówi, gdy asystent odtwarza dźwięk. Układ usuwania echa musi zachować ludzki głos, nie dostosowując się do niego tak, jakby był częścią drogi echa; zbyt agresywne tłumienie może usunąć głos użytkownika, a zbyt słabe pozostawia mowę asystenta.
nieliniowe echo resztkowe łączy filtr adaptacyjny z głęboką siecią na kilku etapach, aby obsługiwać echo resztkowe i składniki nieliniowe. Architektura odzwierciedla fakt, że samo liniowe odejmowanie nie potrafi modelować zniekształceń głośnika, przesterowania i efektów pomieszczenia w każdych warunkach.
Zniekształcenia głośnika zależne od głośności są szczególnie problematyczne, ponieważ sygnał referencyjny odtwarzania jest rejestrowany przed dodaniem nieliniowości przez wzmacniacz i przetwornik. Przemieszczenie urządzenia, zasłonięcie mikrofonu lub zmiana trasy wyjściowej również unieważnia wcześniej zbieżny filtr.
Logika słowa wybudzającego i wejścia użytkownika zamienia echo resztkowe w działanie
Po stłumieniu echa modele aktywności głosowej i słowa wybudzającego decydują, czy mówi człowiek. Niskie progi poprawiają szybkość reakcji, ale mogą interpretować resztkowe sylaby, ogony pogłosu lub artefakty szumu komfortowego jako sygnał do zatrzymania odtwarzania i ponownego otwarcia rozpoznawania.
wspólne przetwarzanie mowy i echa rozwija realizowane w czasie rzeczywistym spersonalizowane wzmacnianie mowy z usuwaniem echa akustycznego przy ścisłych ograniczeniach obliczeniowych. Praca podkreśla potrzebę zachowania docelowej mowy przy jednoczesnym tłumieniu odtwarzania, zamiast traktowania całego mieszanego odcinka jako szumu.
Problemem jest założenie, że przerwanie dowodzi nieskutecznego usuwania echa. Odtwarzanie może również zatrzymać rzeczywisty użytkownik, telewizor, dźwięk powiadomienia lub opóźnione przez sieć zdarzenie sterujące. Rejestruj metryki echa resztkowego, pewność słowa wybudzającego, aktywność głosową i ostateczną decyzję o przerwaniu na tym samym zegarze.
Mierz samoczynne przerwania względem sygnału referencyjnego odtwarzania
Odtwarzaj stałe frazy asystenta przy kilku poziomach głośności w cichym pomieszczeniu, a następnie dodaj wejście użytkownika, mowę z telewizora i przemieszczanie urządzenia. Testuj położenie mikrofonu z bliska i z daleka, rejestrując sygnał referencyjny odtwarzania, surowe sygnały z mikrofonów, dźwięk po usunięciu echa, wyniki słowa wybudzającego, aktywność głosową i znaczniki czasu przerwań.
Porównaj zmienne pomieszczenia z ograniczeniami rozpoznawania głosu z dalekiego pola. Mierz poprawę stosunku powrotu echa, liczbę fałszywych przerwań na godzinę, pominięte rzeczywiste wejścia użytkownika i czas powrotu do działania po zmianie drogi echa, zamiast oceniać wyłącznie czystość brzmienia nagrań.
Dostosuj próg przerwania dopiero po zbieżności układu usuwania echa w reprezentatywnych pomieszczeniach i przy reprezentatywnych poziomach głośności. Jeśli tłumienie samoecha usuwa również rzeczywistych użytkowników, wymagaj dłuższego okna potwierdzenia lub dowodów kierunkowych, zamiast maksymalizować wyłącznie usuwanie echa albo szybkość reakcji.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Dlaczego pobór mocy GPU gwałtownie wzrasta na początku lokalnego żądania wnioskowania?
Zobacz, jak zwiększanie taktowania GPU, wstępne przetwarzanie modelu, inicjalizacja jądra, przydzielanie pamięci i odstępy między próbkowaniami powodują skoki poboru mocy na początku wnioskowania.

Dlaczego ranking wyszukiwania wektorowego zmienia się, gdy jednocześnie przeszukiwanych jest wiele segmentów indeksu?
Dowiedz się, jak limity kandydatów dla poszczególnych segmentów, przybliżone grafy, kalibracja wyników, aktualizacje i konsolidacja zmieniają ranking prywatnego wyszukiwania wektorowego.

Dlaczego grupy duplikatów zdjęć dzielą się po edycji metadanych?
Zobacz, jak dokładne skróty, skróty percepcyjne, orientacja EXIF, znaczniki czasu, wartości progowe i wersje potoku powodują podział prywatnych grup duplikatów zdjęć.

