安全なツール実行は、モデルの外部に設けた強制層によって実現します。制約付きの呼び出し、限定された権限、ポリシーチェック、分離、承認、結果検証、永続的な監査記録などがその要素です。
セルフホスト型エージェントは、NAS上のファイルを読み取ったり、シェルコマンドを実行したり、照明を制御したり、メッセージを送信したりできます。そのため、もっともらしいモデルの応答が実際の副作用につながる可能性があります。モデルは操作を提案するにとどめ、無制限の認証情報を直接引き継ぐべきではありません。信頼できる実行層が対象を解決し、IDとポリシーを確認し、必要に応じて承認を取得し、制限内で実行し、結果を検証します。
型付きツール呼び出しで意図を検査可能なリクエストに変える
ツールスキーマは、許可された操作、必須引数、型、範囲、列挙値を定義します。決定論的な検証によって、実行前に不正な形式や未知のフィールドを拒否できます。また、対象解決によって、分かりやすい名前を現在のデバイス、パス、受信者、リソース識別子へ変換します。
エージェントシステムのセキュリティに関する研究では、エージェントのセキュリティを、分離、アクセス制御、来歴、信頼できる実行境界を含むシステム上の問題として捉えています。これは、確率的な計画や生成の外部に強制処理を置くことを支持します。この区別は、その後の家庭環境でのテストでも確認できます。
構造化出力は必要ですが、それだけでは不十分です。完全に有効なリクエストでも、間違ったフォルダーを削除したり、誤った相手にメッセージを送ったりする可能性があります。そのため、セマンティックバリデーターは、提案された操作を現在の状態、ユーザーID、ワークフローの目的、明示的なポリシーと照合します。
権限とサンドボックスで最大被害を制限する
実行ゲートウェイは、1つのディレクトリへの読み取りアクセスや、1つの照明グループの制御など、範囲を厳密に限定した短時間のみ有効な権限を付与します。続いてサンドボックスが、実行中のファイルシステムパス、プロセス、ネットワーク接続先、CPU、メモリ、時間、出力サイズを制限します。
実用的なエージェント実行サンドボックスの分析では、コンテナ、マイクロVM、WebAssemblyを比較しながら、ホストリソースへのデフォルト拒否アクセスを重視しています。分離方式によって起動コストや互換性は変わりますが、どの方式でも明示的な許可が必要です。自動化を進める前に、中間結果を検査可能な状態に保つ必要があります。
認証情報はモデルのコンテキストの外部に保持し、承認済みの呼び出しに対してのみ注入します。別々のサンドボックスはコード実行からホストを保護し、権限チェックは外部サービスを保護します。どちらか一方で他方を置き換えることはできません。この境界は、現実的な運用条件の下で個別に測定する必要があります。
承認と検証で重大な副作用を防ぐ
ポリシーは操作をリスク別に分類し、許可、拒否、シミュレーション、人による承認の要求のいずれかを決定します。承認画面には、「続行してください」という曖昧な要求ではなく、解決済みの対象、正確なパラメーター、予想される変更、来歴を表示する必要があります。
NVIDIAのエージェント型ワークフローのサンドボックス化に関するガイダンスでは、手動承認を一般的な制御手段として説明し、選択的なサンドボックス化と強制処理を促す要因となる運用上の負担について論じています。これは、読み取り専用の各ステップを中断するのではなく、不可逆な境界に承認を配置することの重要性を示しています。
失敗の境界となるのは、過剰な権限を持つツール、または検証されていない結果です。承認があっても、隠れたコマンドが安全になるわけではありません。また、終了コードが成功を示していても、意図した状態の変更が起きたことは証明できません。影響の大きいワークフローには、独立した事後条件、回数を制限した再試行、べき等性キー、提案、拒否、承認、実行、検査を記録する監査記録が必要です。
エージェントの約束ではなく強制層をテストする
不正な引数、パストラバーサル、認証されていないファイル、ブロック対象のネットワーク接続先、プロンプトインジェクションによる指示、古い対象、重複した再試行、承認の改ざん、タイムアウト、成功を偽って報告するツールを想定したテストケースを作成します。本番環境で使用するものと同じ権限で実行してください。
独立した結果チェックにある独立検証の原則を使い、許可された各操作の後に状態を確認します。拒否された操作が決してツールに到達しないこと、承認が正確なリクエストハッシュに紐付いていること、認証情報がプロンプトやログに含まれないこと、再試行キーによって副作用の重複が防止されることを確認してください。
ポリシーサービス、承認経路、検証システムが利用できない場合に、制御がフェイルクローズすることを確認してからデプロイします。安全性がモデルによるルールの記憶に依存しているなら、ツールに権限を付与する前に、そのルールを実行可能なポリシーへ移してください。
テック&AIハブ
もっと読む

NASファイル全体でのハイブリッド検索を可能にするコンポーネントとは?
正確な識別子と意味が、権限を回避したり不十分な証拠を隠したりすることなく、どのようにして1件の順位付けされたNAS検索結果に結び付くのかを学べます。

RAGで信頼性の高い文書バージョン選択を可能にする機能とは?
RAGが最も類似した古いコピーではなく、適用可能な改訂版を選択する仕組みと、明示的・暗黙的・重複する更新をテストする方法をご覧ください。

エージェントの計画が利用可能なツール権限と乖離する要因とは?
発見、委任、ポリシーフィードバック、再計画によって、AIエージェントが提案する手順と、ツールで実際に実行できることとの整合性がどのように保たれるかを学びます。

