Lokalne rozpoznawanie mowy częściej zawodzi w pomieszczeniach, w których użytkownik znajduje się daleko od mikrofonu, ponieważ odległość osłabia mowę bezpośrednią, podczas gdy odbicia, hałas i konkurencyjne głosy pozostają silne.
Lokalny asystent głosowy w kuchni, salonie lub otwartej przestrzeni mieszkalnej może korzystać z tego samego modelu mowy, który dobrze działa przy mikrofonie laptopa. Sygnał akustyczny nie jest jednak taki sam. Wypowiadane słowa przemieszczają się przez pomieszczenie, tracą poziom, docierają wieloma odbitymi ścieżkami i mieszają się z dźwiękami wentylacji, telewizorów, urządzeń oraz innych osób. Problem może pojawić się jeszcze przed transkrypcją: wykrywanie słowa aktywującego, wykrywanie aktywności głosowej, ustalanie kierunku, poprawa jakości oraz automatyczne rozpoznawanie mowy zależą od użytecznego sygnału.
Odległość zmniejsza udział mowy bezpośredniej
Oddalanie się od mikrofonu zmniejsza poziom bezpośredniego głosu docierającego do kapsuły mikrofonu. Hałas pomieszczenia i dźwięk odbity nie muszą jednak słabnąć w tym samym tempie, przez co pogarsza się stosunek mowy do szumu oraz stosunek dźwięku bezpośredniego do pogłosu.
Wyjaśnienie firmy Shure dotyczące odległości krytycznej opisuje punkt, w którym mowa bezpośrednia i energia pogłosowa stają się porównywalne. Po przekroczeniu tej granicy sama zmiana kierunku mikrofonu nie wystarczy, aby w pełni oddzielić oryginalny głos od odbić, które już dotarły do mikrofonu.
Dlatego głośniejszy model ani większe wzmocnienie wejściowe nie przywrócą utraconej relacji. Wzmocnienie podnosi jednocześnie poziom mowy, hałasu pomieszczenia i pogłosu; nie może odtworzyć dźwięku bezpośredniego, który nie dotarł do mikrofonu w czystej postaci.
Pogłos rozmazuje jeden fonem w następnym
Odbicia docierają po dźwięku bezpośrednim i nakładają się na późniejszą mowę. Krótkie spółgłoski i końcówki wyrazów mogą zostać przykryte przez zanikającą energię wcześniejszych dźwięków, przez co odrębne wzorce akustyczne stają się bardziej podobne.
Przegląd systemów ASR dla mowy z dużej odległości wyjaśnia, że takie potoki przetwarzania często wymagają usuwania pogłosu, separacji źródeł i formowania wiązki przed rozpoznawaniem, ponieważ odległość wprowadza zniekształcenia, z którymi systemy do mowy z bliska nie muszą sobie radzić.
Długie pomieszczenia, twarde podłogi, nieosłonięte ściany i wysokie sufity wydłużają czas nakładania się dźwięków. Rozpoznawanie może więc zawodzić tylko w jednym pomieszczeniu lub po usunięciu mebli, mimo że mikrofon, model i serwer domowy się nie zmieniły.
Hałas tła konkuruje z cichymi fragmentami mowy
Mowa zawiera głośne samogłoski i znacznie cichsze spółgłoski. Zmywarka, wentylator, telewizor, muzyka lub inna rozmowa mogą przykryć ciche fragmenty, które odróżniają podobne słowa.
Badania dotyczące jednoczesnego wpływu hałasu i pogłosu wskazują, że sygnały z mikrofonów znajdujących się daleko od mówcy prowadzą do wysokiego odsetka błędów rozpoznawania, ponieważ zarówno niższy stosunek sygnału do szumu, jak i odbicia w pomieszczeniu zmieniają sygnał wejściowy.
Same średnie odczyty hałasu w pomieszczeniu nie oddają tego efektu. Krótkie uruchomienie blendera, osoba mówiąca w pobliżu lub dialog z telewizora nakładający się na polecenie mogą uszkodzić tylko kilka kluczowych ramek, a mimo to zmienić rozpoznane słowo.
Matryce mikrofonów pomagają tylko wtedy, gdy geometria i przetwarzanie są dopasowane
Kilka mikrofonów może dostarczyć różnic w czasie i poziomie, które wskazują kierunek, z którego mówi osoba. Formowanie wiązki może wzmocnić ten kierunek i stłumić energię docierającą z innych stron.
Badanie z użyciem dwóch mikrofonów pokazuje, jak lokalizacja dźwięku i formowanie wiązki wykorzystują różnice w czasie dotarcia i energii między mikrofonami do oszacowania źródła oraz poprawy przechwyconego sygnału.
Matryca nie jest automatycznie lepsza. Mikrofony rozmieszczone zbyt blisko siebie, zasłonięte kapsuły, nieprawidłowa kolejność kanałów, nieodpowiednia charakterystyka wiązki lub mówca znajdujący się poza oczekiwanym obszarem pokrycia mogą dostarczać słabych albo mylących wskazówek przestrzennych.
Niedopasowanie pomieszczenia i mikrofonu może pokonać dobry model
Model rozpoznający, trenowany głównie na mowie z bliska lub w symulowanych pomieszczeniach, uczy się wzorców, które mogą nie odpowiadać rzeczywistemu umiejscowieniu mikrofonu, czasowi pogłosu, charakterystyce częstotliwościowej hałasu ani kierunkowi mówienia użytkownika.
Praca Samsung Research dotycząca jednokanałowej poprawy jakości mowy z dużej odległości pokazuje, dlaczego tor wejściowy musi być dostosowany do mowy z większej odległości, zamiast zakładać, że uogólni się na podstawie nagrań mowy z bliska.
System domowy może więc działać lepiej, gdy zostanie dostosowany lub oceniony na podstawie nagrań z rzeczywistych pomieszczeń, w których będzie używany. Ogólna dokładność dla czystej mowy nie pozwala przewidzieć skuteczności w kuchni z silnymi odbiciami ani w dużym pokoju multimedialnym.
Poprawa jakości może usunąć mowę razem z hałasem
Tłumienie hałasu i usuwanie pogłosu mają za zadanie oszacować, które składniki należą do mowy. Agresywne ustawienia mogą usuwać słabe spółgłoski, zniekształcać czas trwania dźwięków lub tworzyć artefakty, które dla człowieka brzmią akceptowalnie, ale dezorientują system rozpoznawania.
Badania dotyczące rozszerzania modeli dla mowy z dużej odległości pokazują, dlaczego rozpoznawanie należy trenować i oceniać w zróżnicowanych warunkach akustycznych, zamiast polegać na jednym wyniku czyszczenia dźwięku.
Porównaj nagrania surowe, poprawione i poddane formowaniu wiązki, używając tych samych poleceń. Jeśli brakujące słowo znajduje się w sygnale surowym, ale nie ma go w sygnale przetworzonym, tor wejściowy usuwa użyteczną mowę, zamiast jedynie ujawniać słaby model ASR.
Testuj pomieszczenie, tor wejściowy i system rozpoznawania osobno
Nagraj to samo ustalone polecenie z kilku odległości i pozycji, przy wyłączonych źródłach dźwięku w tle, a następnie powtórz test przy typowym hałasie domowym. Utrzymuj stały poziom głosu i treść wypowiedzi, aby widoczne były wpływy odległości i pomieszczenia.
Analizuj osobno skuteczność wykrywania słowa aktywującego, przechwycony dźwięk, granice aktywności głosowej, wynik poprawy jakości oraz końcową transkrypcję. Błąd rozpoznawania, który zaczyna się od przyciętego nagrania, wymaga innego rozwiązania niż czyste nagranie błędnie zdekodowane przez system.
Wyjaśnienie ZimaSpace dotyczące tego, dlaczego lokalny głos wymaga niskich opóźnień, wskazuje na kolejną granicę: przetwarzanie musi kończyć się szybko, ale skracanie opóźnienia nie powinno obniżać skuteczności wykrywania ani pomijać etapów akustycznych niezbędnych do niezawodnej pracy z dużej odległości.
FAQ
Czy większy model mowy rozwiąże problem odbijającego dźwięk pomieszczenia?
Nie samodzielnie. Większy model może być bardziej odporny, ale znaczny spadek poziomu sygnału wraz z odległością, przesterowanie, pogłos i konkurencyjne głosy nadal usuwają lub zniekształcają informacje, zanim model je otrzyma.
Czy jeden mikrofon wystarczy do sterowania głosem z dużej odległości?
Może działać w małym, cichym pomieszczeniu, przy odpowiednim ustawieniu. Matryce mikrofonów stają się bardziej wartościowe, gdy system musi określać kierunek, odrzucać konkurencyjne źródła lub obejmować większy obszar.
Czy należy zwiększyć wzmocnienie mikrofonu dla osób mówiących z daleka?
Najpierw sprawdź, czy nie występuje przesterowanie i szum. Wzmocnienie może podnieść poziom słabego sygnału, ale jednocześnie zwiększa hałas pomieszczenia i odbicia oraz nie poprawia stosunku dźwięku bezpośredniego do pogłosu.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Dlaczego przewidywania dotyczące inteligentnego domu stają się mniej trafne po sezonowych zmianach rutyny?
Sezonowe rutyny zmieniają zależność między czasem, czujnikami, obecnością domowników a pożądanymi działaniami, przez co model wytrenowany na podstawie wcześniejszych nawyków staje się nieaktualny.

Dlaczego domowy rejestrator NVR pomija krótkie zdarzenia, gdy włączone jest śledzenie obiektów?
Śledzenie wymaga wystarczającej liczby detekcji, aby rozpocząć i potwierdzić trajektorię, dlatego obiekt obecny przez krótki czas może zniknąć, zanim rejestrator NVR utworzy prawidłowe zdarzenie.

Dlaczego etykiety zdjęć generowane przez AI zmieniają się po aktualizacji modelu?
Aktualizacja modelu zmienia sposób reprezentacji i ustalania rankingu używanych do przypisywania etykiet, dlatego to samo zdjęcie może przekroczyć inne granice semantyczne lub poziomy pewności.

