arXiv 2605.06208·2026-05-10 — 次浏览
代理上下文衰减:为何多工具代理在 7 次调用后失去连贯性
Jin Park, Aldous Foster, Maya Sundaram, Yiren Liang · Princeton / DeepMind
多步代理连贯性的实证界限:成功率在 Claude 4.7、GPT-5、Gemini 3 Pro 上于第 7 次工具调用时急剧下降。通过工具轨迹摘要的缓解措施可恢复大部分损失。
本论文形式化了许多构建者贴文中非正式引用的”AgentEval-3”发现:代理在少量工具调用后失去连贯性。作者构建了一个受控任务套件(200 个任务,每个 1-15 次工具调用)并测量成功率作为工具调用深度的函数。
急剧的 7 次调用悬崖
| 任务中工具调用 | Claude 4.7 | GPT-5 | Gemini 3 Pro |
|---|---|---|---|
| 1-3 | 96% | 95% | 93% |
| 4-6 | 91% | 89% | 88% |
| 7 | 78% | 74% | 76% |
| 8-10 | 51% | 48% | 53% |
| 11-15 | 28% | 24% | 31% |
7 次调用拐点在所有三个前沿模型上一致,表明它反映了架构类别(transformer + 标准工具使用 harness)的属性,而非每个模型的训练。
为何是 7?
作者主张这个限制不是上下文窗口容量(所有三个模型都有 >100K token 空间)。相反,对初始任务描述的注意力随工具调用轨迹增长而衰减。到第 7 次调用时,任务描述占模型对下一个决策的有效注意力预算的不到 8%。
有效的缓解措施
| 技术 | 恢复(7-10 次调用范围) |
|---|---|
| 定期任务重述(每 4 次调用重新注入任务) | +18% |
| 工具轨迹摘要(每 5 步压缩之前调用) | +24% |
| 分解为子代理(每个少于 7 次调用) | +31% |
| 组合(重述 + 摘要 + 分解) | +38% |
分解为子代理的结果呼应了 2026 年 5 月 6 日 Anthropic Managed Agents 出货的模式 — 结构性修复是永远不让任何单一代理超过 7 次调用上限。
实践者注记
如果你的代理工作流有长工具调用链,即便在单任务情境下,这也是编排器/工作者模式的实证理由。要记住的数字是 7:将你的子代理设计为动作预算 ≤6 次调用,保留一次调用给”回报给父代理”。对于真正需要 10+ 步的任务,从一开始就应规划多代理分解,而不是希望单一代理能保持连贯。