Skip to content
AI-Daily-Builder

arXiv 2605.06208·2026-05-10 次浏览

代理上下文衰减:为何多工具代理在 7 次调用后失去连贯性

Jin Park, Aldous Foster, Maya Sundaram, Yiren Liang · Princeton / DeepMind

多步代理连贯性的实证界限:成功率在 Claude 4.7、GPT-5、Gemini 3 Pro 上于第 7 次工具调用时急剧下降。通过工具轨迹摘要的缓解措施可恢复大部分损失。

arxiv.org/abs/2605.06208 ↗


本论文形式化了许多构建者贴文中非正式引用的”AgentEval-3”发现:代理在少量工具调用后失去连贯性。作者构建了一个受控任务套件(200 个任务,每个 1-15 次工具调用)并测量成功率作为工具调用深度的函数。

急剧的 7 次调用悬崖

任务中工具调用Claude 4.7GPT-5Gemini 3 Pro
1-396%95%93%
4-691%89%88%
778%74%76%
8-1051%48%53%
11-1528%24%31%

7 次调用拐点在所有三个前沿模型上一致,表明它反映了架构类别(transformer + 标准工具使用 harness)的属性,而非每个模型的训练。

为何是 7?

作者主张这个限制不是上下文窗口容量(所有三个模型都有 >100K token 空间)。相反,对初始任务描述的注意力随工具调用轨迹增长而衰减。到第 7 次调用时,任务描述占模型对下一个决策的有效注意力预算的不到 8%。

有效的缓解措施

技术恢复(7-10 次调用范围)
定期任务重述(每 4 次调用重新注入任务)+18%
工具轨迹摘要(每 5 步压缩之前调用)+24%
分解为子代理(每个少于 7 次调用)+31%
组合(重述 + 摘要 + 分解)+38%

分解为子代理的结果呼应了 2026 年 5 月 6 日 Anthropic Managed Agents 出货的模式 — 结构性修复是永远不让任何单一代理超过 7 次调用上限。

实践者注记

如果你的代理工作流有长工具调用链,即便在单任务情境下,这也是编排器/工作者模式的实证理由。要记住的数字是 7:将你的子代理设计为动作预算 ≤6 次调用,保留一次调用给”回报给父代理”。对于真正需要 10+ 步的任务,从一开始就应规划多代理分解,而不是希望单一代理能保持连贯。

请喝咖啡