デコーディング設定は、次に選択できるトークンを絞り込み、各選択における確率差の影響度を変えることで、ローカルLLMの挙動を変化させます。
ホームモデルは、ある事実に関する質問には一貫して答えられても、長時間の音声セッションでは反復的になったり、創作では不安定になったりすることがあります。重み自体は変わっていません。デコーダーが、各ステップで確率分布から異なる方法で選択しているのです。温度、切り捨て、反復ペナルティ、シード、コンテキストが組み合わさり、出力がよくあるループに収束するのか、低確率の続きへさまようのかが決まります。
トークンを選ぶ前に温度で確信度を再スケーリングする
各ステップで、モデルは可能なトークンにロジットを割り当てます。温度は正規化の前にロジットを再スケーリングします。低い値では差が際立ち、上位候補が選ばれやすくなります。一方、高い値では差が平坦になり、弱い候補にもより多くの確率が与えられます。グリーディデコーディングではサンプリングを行わず、その時点で最大の値を持つ候補を常に選びます。
技術的な解説では、温度とトークンフィルターを区別しています。温度は分布全体の相対確率を変え、top-kは候補数を固定し、top-pは一定の確率質量に達する最小限の集合を維持します。これらは関連していますが、互換性のあるものではありません。
ランダム性を低くすると、書式や事実に基づく表現は安定しますが、その場では魅力的な同じ続きが繰り返し選ばれることがあります。ランダム性を高くすると、その流れから抜け出せる一方で、誤りも入りやすくなります。したがって安定性とは、単に温度を最低にすることではなく、タスクに合わせて分散を制御することです。
信頼度の変化に応じて動的フィルターが候補集合を変える
top-pは累積確率を使用するため、モデルが不確かなときは候補数が増え、1つのトークンが優勢なときは減少します。一方、min-pは最も確率の高いトークンを基準にしきい値を設定します。固定の累積確率質量を目標にせず、信頼度に応じてカットオフを調整します。
min-pサンプリングに関する研究では、テストした高温度設定において、top-pよりも創造性の質と多様性が向上したと報告されています。小規模モデルや量子化モデルは、ホスト型インターフェースが想定するデフォルト設定よりも鋭い、またはノイズの多い分布を持つことがあるため、この仕組みは局所的に重要です。
フィルターはランダム抽選の前に働き、ペナルティは過去のトークンに基づいてスコアを変更します。強い切り捨てと強力な反復ペナルティを組み合わせると、不自然な候補だけが残り、各設定を単独で見ると保守的であっても、出力が不安定に見えることがあります。
ランダム性を増やしても自然さが向上しなくなる地点
創造的な多様性と推論の正確さは、同じようには変化しません。高い温度では多様な物語を生成できますが、算術、コード、引用の忠実性、構造化出力が損なわれる可能性があります。逆に、会話では硬く聞こえても、制約のある抽出にはグリーディデコーディングが適している場合があります。
選択的サンプリングに関する研究では、温度の高い選択は、影響を受けやすいトークン位置で推論能力を低下させる可能性があると示されています。そのため、ランダム性を一律に適用するのではなく、選択的に適用する方法が提案されています。1つのグローバル設定で、あらゆるタスクのすべての部分を最適化することはできません。この違いによって、家庭での最終的な選択も変わります。
失敗の境界は、出力がタスクの制約に違反したときに現れます。たとえば、無効なJSON、根拠のない主張、壊れたコード、反復ループなどです。サンプリングで、弱いプロンプト、不足したコンテキスト、不適切なモデル、破損した会話履歴を修正することはできません。サンプリングが変えるのは、利用可能な確率からの選択方法だけです。
再現可能なサンプリングテストグリッドを作成する
代表的なプロンプトを3つ選びます。決定論的な抽出、通常の会話、自由形式の生成です。モデルファイル、量子化、プロンプト、コンテキスト、最大トークン数を固定します。それぞれについて、温度と1種類の切り捨て方法を組み合わせた小規模なグリッドを実行し、固定シードと複数のランダムシードの両方を使用します。
無効な出力、完全一致するフレーズの反復、ユニークトークン比率、タスクの正確さ、レイテンシを記録します。これにより、長いコンテキストでの一貫性に関する問題からデコーディングを切り分けられます。長い会話コンテキストによって、回答の質が独立して低下する可能性があるためです。この境界は、後の証拠確認でも明確に確認できます。
1つの万能な値ではなく、ワークロードごとに個別のプリセットを選択します。多様性が向上してもタスクの厳格な制約に違反する場合は、そのプリセットを不採用とし、モデル、量子化、プロンプトテンプレート、または反復ペナルティを変更した後にグリッドを再実行します。
テック&AIハブ
もっと読む

多言語埋め込み:1つのベクトル空間が言語の異なる家庭内文書をどのようにつなぐか
多言語間で整合された埋め込みが文書をどのようにつなぐのか、検索品質が変動する理由、そしてクロス言語のエビデンスカバレッジをローカルでテストする方法をご覧ください。

エージェントのメモリにおける矛盾:最近の訂正が繰り返される古い事実に負ける理由
重複した古い記憶が訂正内容を上回る仕組み、最新情報優先のルールが機能しない場面、そして非公開のエージェントメモリーストアで上書きを検証する方法を学びます。

プライベート検索の再ランキング:第2のモデルが最終的な証拠の順序をどのように変えるか
第1段階の類似度と第2段階の関連性が一致しない理由、リランキングがプライベートRAGに役立つ場合、そして並べ替え後の根拠を評価する方法をご覧ください。

