Skip to content
AI-Daily-Builder

arXiv 2605.06208·2026-05-10 次瀏覽

代理上下文衰減:為何多工具代理在 7 次呼叫後失去連貫性

Jin Park, Aldous Foster, Maya Sundaram, Yiren Liang · Princeton / DeepMind

多步代理連貫性的實證界限:成功率在 Claude 4.7、GPT-5、Gemini 3 Pro 上於第 7 次工具呼叫時急劇下降。透過工具軌跡摘要的緩解措施可恢復大部分損失。

arxiv.org/abs/2605.06208 ↗


本論文形式化了許多構建者貼文中非正式引用的「AgentEval-3」發現:代理在少量工具呼叫後失去連貫性。作者構建了一個受控任務套件(200 個任務,每個 1-15 次工具呼叫)並測量成功率作為工具呼叫深度的函數。

急劇的 7 次呼叫懸崖

任務中工具呼叫Claude 4.7GPT-5Gemini 3 Pro
1-396%95%93%
4-691%89%88%
778%74%76%
8-1051%48%53%
11-1528%24%31%

7 次呼叫拐點在所有三個前沿模型上一致,表明它反映了架構類別(transformer + 標準工具使用 harness)的屬性,而非每個模型的訓練。

為何是 7?

作者主張這個限制不是上下文窗口容量(所有三個模型都有 >100K token 空間)。相反,對初始任務描述的注意力隨工具呼叫軌跡增長而衰減。到第 7 次呼叫時,任務描述佔模型對下一個決策的有效注意力預算的不到 8%。

有效的緩解措施

技術恢復(7-10 次呼叫範圍)
定期任務重述(每 4 次呼叫重新注入任務)+18%
工具軌跡摘要(每 5 步壓縮先前呼叫)+24%
分解為子代理(每個少於 7 次呼叫)+31%
組合(重述 + 摘要 + 分解)+38%

分解為子代理的結果呼應了 2026 年 5 月 6 日 Anthropic Managed Agents 出貨的模式 — 結構性修復是永遠不讓任何單一代理超過 7 次呼叫上限。

實踐者注記

如果你的代理工作流有長工具呼叫鏈,即使在單任務情境下,這也是編排器/工作者模式的實證理由。要記住的數字是 7:將你的子代理設計為動作預算 ≤6 次呼叫,保留一次呼叫給「回報給父代理」。對於真正需要 10+ 步的任務,從一開始就應該規劃多代理分解,而不是希望單一代理能持續連貫。

請喝咖啡