AIエージェントのプランナーが完了済みの手順を繰り返す原因は何ですか?

エヴァ・ウォン は テクニカルライター であり ZimaSpaceの常駐ティンカーでもあります。 生涯のオタクであり、 ホームラボとオープンソースソフトウェアに情熱を持っています。彼女は複雑な技術的概念をわかりやすく、 実践的なガイドに翻訳することを専門としています。エヴァはセルフホスティングは楽しくあるべきで、怖がるものではないと信じています。彼女のチュートリアルを通じて、コミュニティが ハードウェアのセットアップを解明する手助けをしています。初めてのNAS構築からDockerコンテナの習得まで。

エージェントプランナーは、実行の証拠がない、曖昧である、忘れられている、または再計画に使用される状態から除外されている場合、完了済みの手順を繰り返します。

ホームAIエージェントは、フォルダーを作成して確認した後、数ターン後に再び同じフォルダーを作成することがあります。ツールが部分的な成功を返す場合や、チェックポイントに完了情報が含まれていない場合、または元の計画を保持したままコンテキスト圧縮によって観測結果が削除される場合があります。タイムアウトや再起動の後、プランナーは未達成の目標を認識し、不完全な状態から同じ手順を合理的に再スケジュールします。

完了は現実世界に存在していても永続状態には存在しない

結果を記録する前にプロセスがクラッシュすると、アクションは成功していても、その結果が失われることがあります。再起動するとメモリ内のチェックリストは消え、プランナーと実行担当の別々のストアが非アトミックに更新されると、計画が保留中のまま残ることがあります。この違いは、後の家庭環境でのテストでも確認できます。

永続的なエージェント状態の概要では、再開、監査、長時間の作業に外部の永続状態が必要な理由を説明しています。特徴的なのは、ツールによる副作用が完了している一方で、チェックポイントが存在しないか古いままになっていることです。自動化を進める前に、中間結果を検査可能な状態に保つ必要があります。

文章による記憶を永続化するよりも、安定した手順ID、アクションダイジェスト、結果、コミット済みステータスを記録する方が確実です。プランナーに必要なのは、単に「完了」と書かれた過去の文ではなく、機械で検証可能な完了情報です。この境界は、現実的な運用条件の下で個別に測定すべきです。

曖昧なツール結果とコンテキストの喪失が進捗を隠す

ツールは、部分的な成功、非同期ジョブID、空の出力、またはコミット後のタイムアウトを返すことがあります。ハーネスがその観測結果を切り詰めたり、要約したり、誤ったラベルを付けたり、添付に失敗したりすると、次のモデル呼び出しには決定的な証拠のない計画だけが渡されます。

エージェントアクションの反復に関するガイドでは、エージェントループが進捗を止める際の主要な失敗として、アクションの反復を挙げています。有用な診断方法は、最新の計画コンテキストに正規化された成功の証拠と、変化した現実世界の状態が含まれているかどうかを確認することです。

モデルが明確な完了状態を受け取っているにもかかわらず繰り返す場合は、プランナーの推論またはタスク分解に原因があります。証拠がモデルに届いていない場合、プロンプトを変更してもデータ経路は修復できません。複数の情報源が限られたコンテキストを奪い合うと、その実際の影響が現れます。

再試行と再計画は非冪等な作業を重複させる可能性がある

一般的な再試行ポリシーでは、通信障害の後に手順全体を繰り返すことがあります。一方、再計画では、新しい手順IDで意味的に同一のアクションが生成されることがあります。弱い停止条件では、目標がすでに達成されていてもループが継続します。

推論とアクションのフィードバックパターンでは、推論、アクション、環境の観測を交互に行い、後続の判断でツールの証拠を利用できるようにします。このフィードバックまたは終了テストが不完全な場合に、反復が発生します。この依存関係は、最終的なインターフェースに明示的に残すべきです。

失敗の境界となるのは、意図的な検証手順または冪等な調整です。状態を再読み込みすることは重複作業ではありません。新しい証拠なしに、課金、削除、メッセージ送信、不可逆な変更を繰り返すことが重複作業です。したがって、結果は元の証拠と照合して確認する必要があります。

手順の識別情報、証拠、停止条件を監査する

計画バージョン、安定した手順ID、アクションダイジェスト、前提条件、ツール呼び出しID、冪等性キー、開始時刻とコミット時刻、生の結果、正規化されたステータス、チェックポイントのバージョン、コンテキストへの包含状況、再試行理由、再計画の対応関係、現実世界の状態の検証、終了判断を追跡します。この違いは、後の家庭環境でのテストでも確認できます。

エージェントループの診断とパターンを比較します。成功した後に応答が失われるケース、部分的な成功、チェックポイント前の再起動、コンテキストの圧縮、完了済みの目標に古い保留手順が1つ残るケースをシミュレーションします。自動化を進める前に、中間結果を検査可能な状態に保つ必要があります。

復旧したエージェントが変更を行う前に現実世界の状態を調整し、冪等性キーを再利用し、再計画されたアクションを以前の手順に対応付け、目標の述語が満たされた時点で停止すれば合格です。再試行回数を制限し、繰り返し実行できないアクションを再実行する前に承認を必須にします。この境界は、現実的な運用条件の下で個別に測定すべきです。

テック&AIハブ

もっと読む

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.