Akustische Echokompensation verbessert die Erkennung im Fernfeld, indem sie die vom Mikrofon aufgezeichnete Lautsprecherwiedergabe schätzt und vor der Spracherkennung entfernt.
Ein Heimassistent, der einen Raum abhört, nimmt neben der anwesenden Person auch die eigene Musik, gesprochene Antworten und Reflexionen von Wänden und Möbeln auf. AEC erhält die unverfälschte Wiedergabereferenz, modelliert, wie der Raum sie verändert, und subtrahiert das vorhergesagte Echo vom Mikrofonsignal. Die Erkennung verbessert sich, wenn das Modell den tatsächlichen Echopfad verfolgt, ohne die Sprache der nahen Schallquelle zu beeinträchtigen.
Die Wiedergabereferenz sagt voraus, was zum Mikrofon zurückkehrt
Das System kennt das digitale Signal, das an den Lautsprecher gesendet wird. Ein adaptiver Filter modelliert Verzögerung, Frequenzgang und Reflexionen zwischen dieser Referenz und dem Mikrofon und erstellt eine Schätzung des Echos, das im aufgezeichneten Gemisch enthalten ist.
Eine ausführliche Erklärung der Modellierung des Echopfads verfolgt Lautsprechersignale durch Raumoberflächen zurück zum Mikrofon und zeigt, warum verzögertes Eigenaudio die Kommunikation stört. Dasselbe aufgezeichnete Echo kann die Erkennung im Fernfeld während der lokalen Wiedergabe dominieren. Diese Unterscheidung bleibt bei späteren Tests im Haushalt sichtbar.
Eine genaue Ausrichtung ist wichtig, da das Subtrahieren der richtigen Wellenform zum falschen Zeitpunkt ein Restecho hinterlässt und unabhängige Sprache entfernen kann. Änderungen der Wiedergabelatenz müssen in das Modell einbezogen werden. Das Zwischenergebnis muss überprüfbar bleiben, bevor die Automatisierung darauf aufbaut.
Adaptive Filterung und Restunterdrückung bereinigen das Gemisch
Der Filter aktualisiert seine Koeffizienten, wenn sich der Raumpfad verändert, subtrahiert das geschätzte lineare Echo und kann verbleibende Komponenten durch eine Restunterdrückung leiten. Die Spracherkennung erhält anschließend ein Signal mit einem höheren Verhältnis von Sprache der nahen Schallquelle zu Echo. Diese Grenze sollte unter realistischen Betriebsbedingungen separat gemessen werden.
Die Forschung zur adaptiven Mehrkanalfilterung beschreibt eine adaptive Mehrkanalfilterung, die Sprache und Rauschen der nahen Schallquelle berücksichtigt. Mikrofonarrays fügen mehrere Echopfade hinzu und erhöhen damit sowohl die verfügbare räumliche Information als auch die Komplexität der Anpassung. Die praktische Folge zeigt sich, wenn mehrere Quellen um begrenzten Kontext konkurrieren.
Bewegungen von Möbeln, Lautstärke des Lautsprechers, Gerätebewegungen und Abweichungen des Abtasttakts können den alten Filter ungenau machen. Die Konvergenzgeschwindigkeit bestimmt, wie lange die Erkennung nach einer Pfadänderung beeinträchtigt bleibt. Diese Abhängigkeit sollte in der endgültigen Benutzeroberfläche ausdrücklich sichtbar bleiben.
Double-Talk schützt die Stimme der anwesenden Person vor der Auslöschung
Wenn Wiedergabe und eine anwesende Person gleichzeitig auftreten, kann eine naive Anpassung die Sprache der nahen Schallquelle als Fehler im Echomodell behandeln und sie verzerren. Die Double-Talk-Erkennung friert die Anpassung ein oder verändert sie, während sie den neuen Sprecher so weit wie möglich bewahrt.
Eine Studie zur Double-Talk-Echokontrolle erklärt den schwierigen Fall, in dem Wiedergabe der fernen Schallquelle und Sprache der nahen Schallquelle gleichzeitig auftreten. Die Restunterdrückung muss Echo entfernen, ohne die Sprache zu löschen, die die Spracherkennung benötigt. Das Ergebnis muss daher mit den ursprünglichen Daten verglichen werden.
Die Fehlergrenze liegt bei nichtlinearer Wiedergabeverzerrung, starker Nachhallbildung, fehlendem Referenzsignal oder einem falschen Timing außerhalb der Kapazität des Modells. AEC kann dann Artefakte hinterlassen, die schlimmer sind als das ursprüngliche Echo, und die Erkennung trotz geringerer gemessener Energie verschlechtern.
Erkennung vor und nach der Echobearbeitung messen
Zeichne festgelegte Befehle bei verschiedenen Entfernungen während Stille, Musikwiedergabe, synthetischer Sprache des Assistenten, Lautstärkeänderungen, Raumbewegungen und Double-Talk auf. Speichere Referenzsignal, rohes Mikrofonsignal, vorhergesagtes Echo, Restsignal, verarbeitetes Audio, Transkripte und Zeitdaten. Diese Unterscheidung bleibt bei späteren Tests im Haushalt sichtbar.
Vergleiche das Muster mit dem Verhalten von Raumechos. Miss die Verbesserung der Echorückflussdämpfung, Sprachverzerrung, Wortfehlerrate, Weckgenauigkeit, Konvergenzzeit und Fehlzurückweisung mit derselben Spracherkennung und derselben Mikrofonposition. Das Zwischenergebnis muss überprüfbar bleiben, bevor die Automatisierung darauf aufbaut.
Aktiviere AEC nur, wenn das verarbeitete Audio die Befehlsgenauigkeit bei Wiedergabe und Double-Talk-Fällen verbessert. Bewahre die Diagnose ohne Verarbeitung auf und teste erneut, nachdem Lautsprecher, Mikrofone, Abtastraten oder Raumakustik geändert wurden. Diese Grenze sollte unter realistischen Betriebsbedingungen separat gemessen werden.
Tech- & KI-Zentrum
Mehr zum Lesen

Was ist Embedding-Drift, und wann muss ein privater Suchindex neu erstellt werden?
Entschlüsseln Sie Modell-, Vorverarbeitungs-, Korpus- und Abfragedrift, unterscheiden Sie zwischen Überwachung und Inkompatibilität und entscheiden Sie, wann ein privater Index neu erstellt werden muss.

Was ist Tokenizer-Kompatibilität, und warum kann sie den Modellwechsel beeinträchtigen?
Entschlüsseln Sie Vokabularidentität, die Semantik spezieller Token, Chatvorlagen, zwischengespeicherte Token, Adapter und Kompatibilitätsprüfungen für den Wechsel lokaler Modelle.

Was ist Modellresidenz, und wann sollte ein lokaler KI-Dienst die Gewichte geladen lassen?
Entschlüsseln Sie Gewichtsspeicherort, Cache-Ebenen, Kaltstarts, Verdrängung, Multiplexing, Speicherdruck und wann ein KI-Dienst zu Hause warm bleiben sollte.

