arXiv 2605.06208·2026-05-10 — 次瀏覽
代理上下文衰減:為何多工具代理在 7 次呼叫後失去連貫性
Jin Park, Aldous Foster, Maya Sundaram, Yiren Liang · Princeton / DeepMind
多步代理連貫性的實證界限:成功率在 Claude 4.7、GPT-5、Gemini 3 Pro 上於第 7 次工具呼叫時急劇下降。透過工具軌跡摘要的緩解措施可恢復大部分損失。
本論文形式化了許多構建者貼文中非正式引用的「AgentEval-3」發現:代理在少量工具呼叫後失去連貫性。作者構建了一個受控任務套件(200 個任務,每個 1-15 次工具呼叫)並測量成功率作為工具呼叫深度的函數。
急劇的 7 次呼叫懸崖
| 任務中工具呼叫 | Claude 4.7 | GPT-5 | Gemini 3 Pro |
|---|---|---|---|
| 1-3 | 96% | 95% | 93% |
| 4-6 | 91% | 89% | 88% |
| 7 | 78% | 74% | 76% |
| 8-10 | 51% | 48% | 53% |
| 11-15 | 28% | 24% | 31% |
7 次呼叫拐點在所有三個前沿模型上一致,表明它反映了架構類別(transformer + 標準工具使用 harness)的屬性,而非每個模型的訓練。
為何是 7?
作者主張這個限制不是上下文窗口容量(所有三個模型都有 >100K token 空間)。相反,對初始任務描述的注意力隨工具呼叫軌跡增長而衰減。到第 7 次呼叫時,任務描述佔模型對下一個決策的有效注意力預算的不到 8%。
有效的緩解措施
| 技術 | 恢復(7-10 次呼叫範圍) |
|---|---|
| 定期任務重述(每 4 次呼叫重新注入任務) | +18% |
| 工具軌跡摘要(每 5 步壓縮先前呼叫) | +24% |
| 分解為子代理(每個少於 7 次呼叫) | +31% |
| 組合(重述 + 摘要 + 分解) | +38% |
分解為子代理的結果呼應了 2026 年 5 月 6 日 Anthropic Managed Agents 出貨的模式 — 結構性修復是永遠不讓任何單一代理超過 7 次呼叫上限。
實踐者注記
如果你的代理工作流有長工具呼叫鏈,即使在單任務情境下,這也是編排器/工作者模式的實證理由。要記住的數字是 7:將你的子代理設計為動作預算 ≤6 次呼叫,保留一次呼叫給「回報給父代理」。對於真正需要 10+ 步的任務,從一開始就應該規劃多代理分解,而不是希望單一代理能持續連貫。