量子化されたローカルモデルは、なぜ長い構造化プロンプトで指示の正確性を失うのか?

エヴァ・ウォン は テクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

量子化されたローカルモデルでは、長く構造化されたプロンプトによって小さな数値誤差が多数の相互作用する制約やトークン判断にわたって増幅されると、指示の正確性が低下することがあります。

短いリクエストでは、1つの事実や形式だけを求める場合があります。一方、長く構造化されたプロンプトには、役割ルール、ネストしたスキーマ、順序要件、除外条件、例、取得した根拠、複数段階の出力チェックなどが組み合わされることがあります。量子化は重み、アクティベーション、または実行時の状態を近似することでモデルのメモリ使用量を削減しますが、その近似がすべての挙動に同じように影響するわけではありません。モデルは流暢さを維持したまま、フィールドを1つ省略したり、後半の指示に違反したり、階層を混同したり、厳密な応答契約から逸脱したりする可能性があります。以下では、低ビット表現と、目に見えるこうした指示失敗の関係を説明します。

量子化はプロンプトを変えずに内部値を変化させる

学習後量子化では、より高精度な値を、表現可能なより少ない段階へ写像します。プロンプトのトークン自体は同一ですが、それを解釈するために使われる隠れアクティベーションや確率計算はわずかに変化します。

複数のモデルファミリーを対象とした幅広い評価では、量子化の影響は、モデルファミリー、数値ターゲット、タスクの種類によって異なり、すべてに共通する単一の精度低下になるわけではないことが示されています。

自由記述の文章では、複数の続きが許容されるため、トークン確率の小さな変動に耐えられます。構造化された指示では、契約を満たすフィールド名、区切り文字、順序、拒否条件が1つしかない場合、許容範囲が狭くなります。

一般的な流暢さより先に指示追従が低下することがある

量子化されたモデルは、首尾一貫した段落を書いたり、よく知る質問に答えたりできても、明示された制約を満たす一貫性が低下する場合があります。

近年の研究では、量子化後の指示追従の低下が具体的に研究されており、通常のパープレキシティ最適化ではなく、対象を絞った回復が必要になる可能性のある挙動として扱われています。

そのため、見かけ上は能力の高い回答でも、必須キーが欠落していたり、禁止されたセクションが含まれていたり、実際のルールよりも例に強く従っていたりするという、判断しにくいテスト結果が生じます。

したがって、検証では読みやすさや話題の正確性とは別に、契約への準拠を評価する必要があります。

長いプロンプトでは制約の位置と競合がより重要になる

構造化されたプロンプトでは、指示がコンテキストの冒頭、中間、末尾に分散することがよくあります。取得した文書や例によって、ルールと出力の間に何千もの競合するトークンが挿入されることもあります。

長文脈に関する研究では、量子化を導入する前から、情報の位置に左右された利用が確認されています。

量子化によって、正しい解釈と近い別の解釈との間の差が小さくなることがあります。位置や競合するコンテキストによってすでに弱く表現されているルールは、見落とされやすくなります。

すべての指示を繰り返すことは、確実な解決策ではありません。階層を明確にしないまま繰り返すと、プロンプトが長くなり、追加の競合が生じる可能性があります。

キャリブレーションデータが構造化されたプロンプトの挙動を表していない可能性がある

多くの学習後手法では、キャリブレーション用サンプルからスケールやクリッピングの挙動を決定します。通常の文章が中心のサンプルでは、JSONスキーマ、コードブロック、表、長い複数部分の指示と同じアクティベーションパターンを維持できない可能性があります。

量子化ツールでは、キャリブレーションデータを必要とする手法と、動的または学習を考慮した手法が区別されています。

キャリブレーションセットは平均的な言語挙動を維持できても、ホームサーバー上で重要となる具体的なワークフローを十分に表していない場合があります。

実際に使用するプロンプトテンプレート、言語、区切り文字、スキーマ、文書形式を含むサンプルを使い、展開するモデルが従う必要のある条件を反映させてください。

KVキャッシュの精度が長い応答の後半に影響する可能性がある

一部のランタイムでは、モデルの重みだけでなく、アクティブなコンテキストの注意状態を保存するキー・バリューキャッシュも量子化します。

Google Researchは、長距離コンテキストのメモリコストを削減しながら生成性能を維持する方法として、KVキャッシュ量子化を紹介しています。

キャッシュは、過去のプロンプトトークンと出力トークンを表します。そこに近似が生じると、後続のデコードでネストした要件や、すでに生成された構造にどのように注意を向けるかに影響する可能性があります。

したがって、重みのみの構成と、重みおよびキャッシュを量子化する構成は、単一の一般的なビット幅のラベルにまとめず、別々に評価する必要があります。

構造化された信頼性にはエンドツーエンドのワークフローテストが必要

本番環境で使用する量子化済みファイル、ランタイム、コンテキスト長、キャッシュ形式、サンプリング設定、出力パーサーをそのままテストしてください。ベースモデルのベンチマークだけでは、別のローカル変換を検証できません。

NVIDIAは、選択した推論手法やハードウェア経路によってメモリ、スループット、品質が変化するため、モデル固有のトレードオフを評価することを推奨しています。

ZimaSpaceのローカル展開の制約でも、モデルを読み込めるかどうかと、想定するコンテキストや同時実行数で信頼性を維持できるかどうかを分けて説明しています。

ネストしたオブジェクト、任意フィールド、後半の制約、繰り返しの定型文、競合する例、拒否ケースを含む、敵対的な構造化テストを作成してください。適切な量子化とは、ワークフローの指示正確性のしきい値をなお満たせる、最も軽量な形式です。

よくある質問

パープレキシティが低ければ、指示追従も必ず向上しますか?

いいえ。パープレキシティはトークン列に対する予測適合度を測定しますが、指示の正確性は、厳密な制約、スキーマの妥当性、拒否の挙動に左右される場合があります。

量子化された大規模モデルは、フル精度の小規模モデルより必ず指示に従いやすくなりますか?

いいえ。モデルの能力、アライメント、量子化手法、プロンプトの長さ、ランタイム、タスクの契約など、さまざまな要因が結果に影響します。

プロンプトを書き換えれば、量子化による失敗をすべて回復できますか?

いいえ。明確な階層や短いプロンプトは役立ちますが、失敗が続く場合は、より高精度な形式、別の量子化器、または別のモデルが必要になる可能性があります。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.