言語を混在させると、すべての言語、ドメイン、クエリの方向性が多言語埋め込みで同じように整列されるわけではないため、ベクトル検索の再現率が低下することがあります。
ホームインデックスは、英語のマニュアルやメモから始まり、中国語の領収書、スペイン語のメッセージ、日本語の商品ページ、あるいは複数の言語が混在した家族向け文書が追加されることがあります。ベクトルデータベースは依然として同じ最近傍探索を実行しますが、表現空間は変化しています。言語ごとに空間内で占める領域が不均一になったり、概念の共有が不完全だったり、トークン化の効率が異なったり、新たな難しい負例が生まれたりします。その結果、単一のグローバルな top-k では、優勢な言語が優先されたり、意味的には広いものの異なる言語の近傍が取得されたりして、関連する文章を取り逃がすことがあります。
多言語モデルは同等の意味を互いに近く配置する必要がある
異なる言語間の検索が機能するのは、ある言語のクエリと、別の言語で書かれた関連文書が、共有埋め込み空間内の互換性のある領域にマッピングされる場合だけです。
LaBSE は、大規模な単言語および対訳データを使用して、言語非依存の埋め込みを作成するよう設計されています。
多くの言語をサポートしているからといって、すべての言語で検索品質が同一になるわけではありません。整列の度合いは、各言語が学習中にどれだけの、そしてどのような種類のデータを提供したかに左右されます。
学習データの不均衡は言語ごとに異なる幾何構造を生む
高リソース言語では通常、モデルの学習中に利用できるテキスト、翻訳ペア、難しい負例が多くなります。低リソースの言語やドメイン固有の言語変種では、整列が弱くなる可能性があります。
多言語表現に関する研究では、言語ごとの性能差が報告されており、その原因として異言語間の整列データの限界が挙げられています。
こうした言語を1つのホームインデックスに追加すると、共通のコサイン類似度しきい値や top-k は、埋め込みモデルが実際には提供していない可能性のある比較可能性を前提としてしまいます。
優勢な言語では適切に調整されているように見えても、別の言語では関連する近傍がひそかに失われることがあります。
単言語検索と異言語間検索は異なるテストである
英語のクエリで英語の文書を取得する場合、言語内の意味検索をテストしています。一方、中国語のクエリで英語のマニュアルを取得する場合は、関連性だけでなく異言語間の整列もテストしています。
M3-Embedding は、密ベクトル、スパース、マルチベクトル表現にまたがる多言語検索モードを評価します。
クエリと文書が同じ言語の場合は高い性能を発揮するモデルでも、言語が異なると再現率が低下することがあります。両方のケースを1つの指標に平均すると、どの方向で失敗しているのかが隠れてしまいます。
言語ペアを明示的に測定してください。英語から中国語への検索が、中国語から英語への検索と同じように機能するとは限りません。
1つの埋め込みモデルでは英語の品質と幅広い対応範囲がトレードオフになることがある
多言語エンコーダーにはモデル容量の限界があり、多様な文字体系、語彙、意味分布を表現する必要があります。
Arctic-Embed 2.0 は、言語対応範囲を広げても従来の英語性能に影響がないと仮定するのではなく、多言語検索のバランスを検討しています。
言語を混在させると、英語の関連文書は、他の言語における意味的に類似した候補からも影響を受ける可能性があります。モデルは、言語間の同等性と、各言語内の細かな違いの両方を維持しなければなりません。
ハブネスにより、一部の多言語ベクトルが過剰に出現することがある
高次元空間では、少数のベクトルが無関係な多くのクエリに対する最近傍になることがあります。こうしたハブが top-k の位置を占有すると、本来含まれるべき関連情報が押し出されます。
最近の多言語分析では、異言語間のハブネスが、非対称な検索挙動の要因として特定されています。
言語を混在させると、単一言語のインデックスでは目立たなかったハブが明らかになることがあります。特に、一般的な定型文、翻訳テンプレート、短く頻出するフレーズの周辺で起こりやすくなります。
失敗の原因によっては、重複除去、より優れた負例、言語を考慮したフィルタリング、再ランキング、ハブを考慮したスコアリングによって再現率を回復できる可能性があります。
トークン化と文書の長さは表現品質を変える
同じ量の意味を表す場合でも、言語や文字体系によって必要なトークン数は大きく異なります。そのため、文字数やトークン数の固定上限でチャンク分割すると、意味単位に偏りが生じます。
MMTEB は、英語中心の小規模なベンチマークだけに依存せず、数百の言語と検索タスクにわたって多言語埋め込みを評価します。
英語の段落向けに調整されたチャンク分割器では、中国語、日本語、膠着語、または複数言語が混在した文書を適切でない境界で分割してしまうことがあります。その結果、ベクトルが不完全な情報や、範囲が広すぎる情報を表すことになります。
言語ペアに応じて検索を評価・振り分ける
重要なすべてのクエリ言語、文書言語、検索方向について、ラベル付きの検索データを作成してください。固有名詞、言い換え、コードスイッチング、表、OCRテキスト、家庭内で使われる用語を含めます。
Snowflake の多言語埋め込みに関する取り組みでは、1つのグローバル平均では意味のある差異が隠れる可能性があるため、言語ごとの評価を報告しています。
ZimaSpace のNASの意味検索インデックスガイドが示すように、ベクトルモデルがその言語をサポートしている場合でも、抽出とチャンクの品質は検索の一部であり続けます。
測定した再現率が許容範囲内であれば、1つの多言語インデックスを使用します。そうでなければ、言語フィルター、ハイブリッドなキーワード検索、翻訳を補助に用いたクエリ、言語ごとの検索器、または弱い方向を補うクロスエンコーダーの再ランキングを追加します。
テック&AIハブ
もっと読む

機密ファイルを取り巻くホームAIの信頼境界を実現する機能とは?
家庭用AIの信頼境界は、保存時暗号化、最小権限のアクセス許可、ランタイムサンドボックス化、スコープを限定した検索を組み合わせたものであり、単一の機能だけでは成り立ちません。

プライベート検索結果が頻繁に編集されたファイルを優先する原因とは?
頻繁に編集されるファイルは、更新のたびに鮮度、チャンク、バージョン、またはインタラクションシグナルが追加され、ソースによる正規化が行われない場合、ランキング上の優位性を獲得します。

スマートホームの在宅検知モデルが来客と住人を混同する原因とは?
システムが世帯の活動パターンを観測していても、その活動を生み出している人物の安定した識別情報がない場合、来訪者が居住者のように見えることがあります。

