arXiv 2605.06208·2026-05-10 — 回閲覧
エージェント・コンテキスト減衰:なぜマルチツール・エージェントは 7 コール後にコヒーレンスを失うのか
Jin Park, Aldous Foster, Maya Sundaram, Yiren Liang · Princeton / DeepMind
マルチステップ・エージェント・コヒーレンスの実証境界:Claude 4.7、GPT-5、Gemini 3 Pro 全体で成功率が第 7 ツール・コールで急落。ツール・トレース・サマライゼーションによる軽減策で損失の大部分を回復。
本論文は多くのビルダー投稿で非公式に引用されている「AgentEval-3」の発見を形式化する:エージェントは少数のツール・コール後にコヒーレンスを失う。著者は制御されたタスク・スイート(200 タスク、それぞれ 1〜15 ツール・コール)を構築し、ツール・コール深度の関数として成功率を測定。
急峻な 7 コール崖
| タスク内ツール・コール | Claude 4.7 | GPT-5 | Gemini 3 Pro |
|---|---|---|---|
| 1-3 | 96% | 95% | 93% |
| 4-6 | 91% | 89% | 88% |
| 7 | 78% | 74% | 76% |
| 8-10 | 51% | 48% | 53% |
| 11-15 | 28% | 24% | 31% |
7 コール屈曲点は 3 つのフロンティア・モデル全てで一貫しており、これがモデルごとの訓練ではなくアーキテクチャ・クラス(トランスフォーマー + 標準ツール使用ハーネス)の特性を反映していることを示唆する。
なぜ 7 か
著者はこの限界がコンテキスト・ウィンドウ容量ではないと主張(3 モデルとも 10 万トークン超の空きがあった)。代わりに、初期タスク記述への注意がツール・コール・トレースが成長するにつれて減衰する。第 7 コールまでに、タスク記述は次の決定に対するモデルの有効な注意予算の 8% 未満を占める。
機能する緩和策
| 技術 | 回復(7-10 コール範囲) |
|---|---|
| 定期的タスク再記述(4 コールごとにタスクを再注入) | +18% |
| ツール・トレース・サマライゼーション(5 ステップごとに前のコールを圧縮) | +24% |
| サブエージェントへの分解(各 7 コール未満) | +31% |
| 組み合わせ(再記述 + サマライゼーション + 分解) | +38% |
サブエージェントへの分解結果は、2026 年 5 月 6 日に Anthropic Managed Agents が出荷したパターンを反映する — 構造的修正は、いかなる単一エージェントも 7 コール上限を超えさせないこと。
実務者のメモ
エージェント・ワークフローに長いツール・コール・チェーンがある場合、単一タスク・シナリオであっても、これがオーケストレータ/ワーカー・パターンの実証的正当化となる。記憶すべき数字は 7:サブエージェントを ≤6 コールのアクション予算で設計し、1 コールを「親に報告」用に予約する。本当に 10 ステップ以上が必要なタスクには、単一エージェントがそれを通してコヒーレンスを保つことを期待するのではなく、最初からマルチエージェント分解を計画すべき。