음향 에코 제거는 마이크에 포착된 스피커 재생음을 추정하고 음성 인식 전에 제거하여 원거리 인식 성능을 향상합니다.
방 건너편에서 듣는 홈 어시스턴트는 거주자의 목소리뿐 아니라 자신의 음악, 음성 응답, 벽과 가구에서 반사된 소리도 함께 듣습니다. AEC는 깨끗한 재생 기준 신호를 받아 방이 이를 어떻게 변형하는지 모델링하고, 마이크 오디오에서 예측된 에코를 차감합니다. 모델이 실제 에코 경로를 추적하면서 근거리 음성을 손상시키지 않을 때 인식 성능이 향상됩니다.
재생 기준 신호는 마이크로 돌아오는 소리를 예측합니다
시스템은 스피커로 전송되는 디지털 신호를 알고 있습니다. 적응형 필터는 기준 신호와 마이크 사이의 지연, 주파수 응답, 반사음을 모델링하여 포착된 혼합 신호에 포함된 에코를 추정합니다.
자세한 에코 경로 모델링 설명은 스피커 오디오가 방의 표면을 거쳐 마이크로 되돌아오는 과정을 추적하고, 지연된 자체 오디오가 통신을 방해하는 이유를 보여 줍니다. 동일하게 포착된 에코는 로컬 재생 중 원거리 인식을 지배할 수 있습니다. 이러한 차이는 이후 가정 환경 테스트에서도 확인할 수 있습니다.
적절한 파형을 잘못된 시간에 빼면 잔여 에코가 남거나 관련 없는 음성이 제거될 수 있으므로 정확한 정렬이 중요합니다. 재생 지연의 변화도 모델에 포함해야 합니다. 자동화가 이어지기 전에 중간 결과를 확인할 수 있어야 합니다.
적응형 필터링과 잔여 억제가 혼합 신호를 정리합니다
필터는 방의 경로가 변함에 따라 계수를 업데이트하고, 추정된 선형 에코를 차감한 뒤 남은 성분을 잔여 억제기로 전달할 수 있습니다. 그러면 인식기는 근거리 음성과 에코의 비율이 더 높은 오디오를 받게 됩니다. 이러한 경계는 현실적인 작동 조건에서 별도로 측정해야 합니다.
다채널 적응형 필터링 연구에서는 근거리 음성과 노이즈를 고려하는 다채널 적응형 필터링을 정식화합니다. 마이크 어레이는 여러 에코 경로를 추가하므로 활용 가능한 공간 정보와 적응 복잡도가 모두 증가합니다. 여러 소스가 제한된 컨텍스트를 두고 경쟁할 때 이러한 실질적인 영향이 나타납니다.
가구 이동, 스피커 볼륨, 기기 움직임, 샘플 클록 불일치는 기존 필터를 부정확하게 만들 수 있습니다. 수렴 속도에 따라 경로가 변경된 후 인식이 얼마나 오래 영향을 받는지가 결정됩니다. 이러한 의존성은 최종 인터페이스에 명확히 남겨 두어야 합니다.
더블 토크는 거주자의 음성이 제거되지 않도록 보호합니다
재생과 거주자의 음성이 동시에 발생할 때 순진한 적응 방식은 근거리 음성을 에코 모델의 오류로 간주하여 음성을 왜곡할 수 있습니다. 더블 토크 감지는 새로운 화자를 최대한 보존하면서 적응을 일시 중지하거나 조정합니다.
더블 토크 에코 제어 연구는 원거리 재생과 근거리 음성이 공존하는 어려운 상황을 설명합니다. 잔여 억제는 인식기에 필요한 음성을 지우지 않으면서 에코를 제거해야 합니다. 따라서 결과를 원본 증거와 비교하여 확인해야 합니다.
실패 경계는 비선형 재생 왜곡, 심한 잔향, 누락된 기준 오디오 또는 모델의 처리 능력을 넘어서는 잘못된 타이밍입니다. 이 경우 AEC는 원래 에코보다 더 심한 인공음을 남길 수 있으며, 측정된 에너지가 감소하더라도 인식 성능을 떨어뜨릴 수 있습니다.
에코 처리 전후의 인식 성능을 측정합니다
무음, 음악, 합성된 어시스턴트 음성, 볼륨 변화, 방 안의 움직임, 더블 토크 상황에서 여러 거리의 고정 명령을 녹음합니다. 기준 신호, 원시 마이크 오디오, 예측된 에코, 잔여 신호, 처리된 오디오, 전사 결과, 타이밍을 저장합니다. 이러한 차이는 이후 가정 환경 테스트에서도 확인할 수 있습니다.
방의 에코 동작과 비교합니다. 동일한 인식기와 마이크 배치를 사용하여 에코 반환 손실 향상, 음성 왜곡, 단어 오류율, 호출 정확도, 수렴 시간, 오인 거부를 측정합니다. 자동화가 이어지기 전에 중간 결과를 확인할 수 있어야 합니다.
처리된 오디오가 재생 및 더블 토크 상황에서 명령 정확도를 향상할 때만 AEC를 활성화합니다. 바이패스 진단 기능을 유지하고 스피커, 마이크, 샘플 레이트 또는 방의 음향을 변경한 후 다시 테스트합니다. 이러한 경계는 현실적인 작동 조건에서 별도로 측정해야 합니다.
기술 및 AI 허브
더 읽어보기

임베딩 드리프트란 무엇이며, 프라이빗 검색 인덱스를 언제 다시 구축해야 할까요?
모델, 전처리, 코퍼스 및 쿼리 드리프트를 해석하고, 모니터링과 비호환성을 구분하며, 프라이빗 인덱스를 언제 재구축해야 하는지 판단하세요.

토크나이저 호환성이란 무엇이며, 모델 전환을 중단시킬 수 있는 이유는 무엇인가요?
로컬 모델 전환을 위한 어휘 식별자, 특수 토큰 의미, 채팅 템플릿, 캐시된 토큰, 어댑터 및 호환성 검사를 해독합니다.

모델 상주성이란 무엇이며, 로컬 AI 서비스는 언제 가중치를 로드된 상태로 유지해야 할까요?
가중치 상주, 캐시 수준, 콜드 스타트, 축출, 멀티플렉싱, 메모리 압박, 그리고 홈 AI 서비스를 웜 상태로 유지해야 하는 시점을 설명합니다.

