ローカルLLMのサンプリング:デコード設定が反復と安定性を変える理由

エヴァ・ウォンテクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

デコーディング設定は、次に選択できるトークンを絞り込み、各選択における確率差の影響度を変えることで、ローカルLLMの挙動を変化させます。

ホームモデルは、ある事実に関する質問には一貫して答えられても、長時間の音声セッションでは反復的になったり、創作では不安定になったりすることがあります。重み自体は変わっていません。デコーダーが、各ステップで確率分布から異なる方法で選択しているのです。温度、切り捨て、反復ペナルティ、シード、コンテキストが組み合わさり、出力がよくあるループに収束するのか、低確率の続きへさまようのかが決まります。

トークンを選ぶ前に温度で確信度を再スケーリングする

各ステップで、モデルは可能なトークンにロジットを割り当てます。温度は正規化の前にロジットを再スケーリングします。低い値では差が際立ち、上位候補が選ばれやすくなります。一方、高い値では差が平坦になり、弱い候補にもより多くの確率が与えられます。グリーディデコーディングではサンプリングを行わず、その時点で最大の値を持つ候補を常に選びます。

技術的な解説では、温度とトークンフィルターを区別しています。温度は分布全体の相対確率を変え、top-kは候補数を固定し、top-pは一定の確率質量に達する最小限の集合を維持します。これらは関連していますが、互換性のあるものではありません。

ランダム性を低くすると、書式や事実に基づく表現は安定しますが、その場では魅力的な同じ続きが繰り返し選ばれることがあります。ランダム性を高くすると、その流れから抜け出せる一方で、誤りも入りやすくなります。したがって安定性とは、単に温度を最低にすることではなく、タスクに合わせて分散を制御することです。

信頼度の変化に応じて動的フィルターが候補集合を変える

top-pは累積確率を使用するため、モデルが不確かなときは候補数が増え、1つのトークンが優勢なときは減少します。一方、min-pは最も確率の高いトークンを基準にしきい値を設定します。固定の累積確率質量を目標にせず、信頼度に応じてカットオフを調整します。

min-pサンプリングに関する研究では、テストした高温度設定において、top-pよりも創造性の質と多様性が向上したと報告されています。小規模モデルや量子化モデルは、ホスト型インターフェースが想定するデフォルト設定よりも鋭い、またはノイズの多い分布を持つことがあるため、この仕組みは局所的に重要です。

フィルターはランダム抽選の前に働き、ペナルティは過去のトークンに基づいてスコアを変更します。強い切り捨てと強力な反復ペナルティを組み合わせると、不自然な候補だけが残り、各設定を単独で見ると保守的であっても、出力が不安定に見えることがあります。

ランダム性を増やしても自然さが向上しなくなる地点

創造的な多様性と推論の正確さは、同じようには変化しません。高い温度では多様な物語を生成できますが、算術、コード、引用の忠実性、構造化出力が損なわれる可能性があります。逆に、会話では硬く聞こえても、制約のある抽出にはグリーディデコーディングが適している場合があります。

選択的サンプリングに関する研究では、温度の高い選択は、影響を受けやすいトークン位置で推論能力を低下させる可能性があると示されています。そのため、ランダム性を一律に適用するのではなく、選択的に適用する方法が提案されています。1つのグローバル設定で、あらゆるタスクのすべての部分を最適化することはできません。この違いによって、家庭での最終的な選択も変わります。

失敗の境界は、出力がタスクの制約に違反したときに現れます。たとえば、無効なJSON、根拠のない主張、壊れたコード、反復ループなどです。サンプリングで、弱いプロンプト、不足したコンテキスト、不適切なモデル、破損した会話履歴を修正することはできません。サンプリングが変えるのは、利用可能な確率からの選択方法だけです。

再現可能なサンプリングテストグリッドを作成する

代表的なプロンプトを3つ選びます。決定論的な抽出、通常の会話、自由形式の生成です。モデルファイル、量子化、プロンプト、コンテキスト、最大トークン数を固定します。それぞれについて、温度と1種類の切り捨て方法を組み合わせた小規模なグリッドを実行し、固定シードと複数のランダムシードの両方を使用します。

無効な出力、完全一致するフレーズの反復、ユニークトークン比率、タスクの正確さ、レイテンシを記録します。これにより、長いコンテキストでの一貫性に関する問題からデコーディングを切り分けられます。長い会話コンテキストによって、回答の質が独立して低下する可能性があるためです。この境界は、後の証拠確認でも明確に確認できます。

1つの万能な値ではなく、ワークロードごとに個別のプリセットを選択します。多様性が向上してもタスクの厳格な制約に違反する場合は、そのプリセットを不採用とし、モデル、量子化、プロンプトテンプレート、または反復ペナルティを変更した後にグリッドを再実行します。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.