話者ダイアライゼーションは、プライベートな音声アーカイブでどのように声を分離するのか?

エヴァ・ウォンテクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

話者ダイアライゼーションは、音声の位置を特定し、話者の特徴を埋め込み、類似したセグメントをクラスタリングして、音声のタイムラインに話者ラベルを割り当てることで、声を分離します。

プライベートなアーカイブには、インタビュー、会議、ホームビデオ、ボイスメモなど、言葉だけでは十分でない録音が含まれることがあります。ダイアライゼーションは、録音を家庭内サーバーの外部に送信することなく、「いつ誰が話したか」という構造を追加します。

ダイアライゼーションはまず音声の存在する場所を特定する

話者ダイアライゼーションは通常、音声と無音・非音声のオーディオを分離することから始まります。これにより、音楽、室内の環境音、長い無音区間が、話者の識別に関する誤った根拠になるのを防ぎます。

NVIDIAは、音声活動検出から始まり、その後に話者埋め込みとクラスタリングを行うカスケード型ダイアライゼーションパイプラインについて説明しています。VADの段階では、音声領域のタイムスタンプが生成されます。NeMoはダイアライゼーションを、音声検出、話者表現、クラスタリングの段階に分けています。これは、NVIDIA NeMoのダイアライゼーションパイプラインで話者を割り当てる前に、まず音声のタイムラインが必要になる理由を示しています。

ホームサーバーでは、これにより不要な処理を減らせるだけでなく、早い段階での失敗境界も作れます。ここで小さな声の一部が切り取られると、その後の話者クラスタリングで失われた音声セグメントを復元することはできません。

話者埋め込みによって音声セグメントを比較可能にする

検出された各音声領域は、話者埋め込みに変換されます。これは、声を区別するのに役立つ特徴を保持したコンパクトなベクトルです。

NeMoは、クラスタリングの前に話者埋め込みを抽出するパイプラインを文書化しています。これらのベクトルが表すのは話者間の類似性であり、家族の一員の実名ではありません。Google Researchは、話者表現を現代のダイアライゼーションシステムの中核として説明しており、Googleの話者ダイアライゼーション研究にあるように、セグメント間で誰が話しているかを比較するために埋め込みが使われています。

つまり、プライベートなアーカイブでは、身元データベースを維持しなくても「話者1」「話者2」を生成できます。

クラスタを実在の人物に対応付ける作業は、別途行う登録またはラベリングのステップです。

クラスタリングによって類似した埋め込みを話者ラベルに変換する

埋め込みが作成されると、システムは類似したベクトルをクラスタにまとめます。各クラスタは、その録音における暫定的な話者の身元になります。

NVIDIAは、話者埋め込みをグループ化するモジュールとしてクラスタリングを挙げています。このグループ化は、文字起こしされる言葉ではなく、音響的な類似性に基づきます。Microsoft Researchは、学習された話者埋め込みとクラスタリングを関連するダイアライゼーションの課題として扱っており、Microsoft Researchの話者クラスタリング研究で説明されているクラスタリング段階を裏付けています。

このため、ダイアライゼーションと音声認識は別のものです。文字起こしに誤った単語が含まれていても、その周辺の音声は正しい話者クラスタに帰属できる場合があります。

ターン境界によって話者が変わるタイミングを決める

録音は連続しているため、パイプラインはどのクラスタが適合するかだけでなく、ある話者の発話ターンがどこで終わり、別の話者のターンがどこで始まるかも判断する必要があります。

NeMoは、異なるセグメント長の埋め込みを使うマルチスケール・ダイアライゼーションに対応しています。長いウィンドウは話者の同一性を安定させ、短いウィンドウは急速な変化の位置を特定するのに役立ちます。pyannoteの話者ダイアライゼーション研究で示されているように、現代のダイアライゼーションシステムは、録音全体に1つの話者ラベルを割り当てるのではなく、話者ターンとセグメンテーション境界を明示的にモデル化します。

素早い家庭内の会話では、このトレードオフが明らかになります。ウィンドウが長すぎると、短い話者交代が曖昧になることがあります。

ウィンドウが短すぎると、安定したクラスタリングに必要な音声情報が不足する場合があります。

話者ラベルを検索可能な文字起こしに再び対応付ける

話者ターンが得られると、そのタイムスタンプをASRの出力に対応付けることで、アーカイブには「何が話されたか」と「誰が話した可能性が高いか」の両方を保存できます。

NVIDIAは、ダイアライゼーションを音声認識と並行して「いつ誰が話したか」に答えるものと定義しています。そのため、2つのレイヤーは独立して再実行できます。デバイス上のダイアライゼーションに関する研究では、話者分離をローカルで実行できることが示されており、デバイス上の話者ダイアライゼーション研究が示すように、クラウド処理を必要とせず、プライベートな音声アーカイブにダイアライゼーションを活用できます。

この仕組みは、通常のダイアライゼーションパイプラインが確立された後に発生するクラスタのドリフトに焦点を当てた、ZimaSpaceによる長時間の文字起こしにおける話者の入れ替わりの分析を補完します。

重なりと音響変化が実用上の限界を決める

2人が同時に話すと、セグメントごとに1人の話者がいるという単純な前提が崩れます。

混在したセグメントからは、どちらの声にも明確には属さない埋め込みが生成されることがあります。

NeMoは、クラスタリングパイプラインと、話者ラベルを推定するターゲット話者VADなどのニューラル手法を区別しています。これらの手法は重なりへの対応に役立ちますが、難しい音響条件をなくすものではありません。IBM Researchも、重なりや変化する音響条件の難しさを強調しており、IBMの話者ダイアライゼーション研究で説明されている、ダイアライゼーションの実用上の限界を裏付けています。

距離や残響も、身元の特徴を歪める可能性があります。ZimaSpaceの遠距離音声認識の分析では、認識とダイアライゼーションの両方に影響を及ぼし得る、上流の音響変化について説明しています。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.