大语言模型智能体中的跨任务技能迁移:子任务与文本胜出
为什么值得读 构建自主智能体的开发者可以通过将记忆结构化为文本形式的子任务来提高可靠性。所提出的效用分数提供了一种执行前的诊断手段,用于筛选有效技能。
研究发现,基于子任务的归纳和文本格式能使大语言模型智能体实现可靠的技能迁移,其效果优于基于任务和代码的方法。
为什么值得读 构建自主智能体的开发者可以通过将记忆结构化为文本形式的子任务来提高可靠性。所提出的效用分数提供了一种执行前的诊断手段,用于筛选有效技能。
研究发现,基于子任务的归纳和文本格式能使大语言模型智能体实现可靠的技能迁移,其效果优于基于任务和代码的方法。
为什么值得读 主题是从「更好的模型」转向「可靠的自主性」。Outcomes(评分代理执行的 grader loop)与 Dreaming(排程记忆整理)是「可放着无人看管执行的代理」的基建 —— 那才是企业代理部署的真正阻碍,不是模型 IQ。
在 Code with Claude 伦敦(5/20-21),Anthropic 推出 5 个代理功能 —— Dreaming、Outcomes、多代理协调、10 个代理的 Claude Finance、Add-ins —— 加上 Claude for Small Business 整合。
为什么值得读 论点是对量的真实押注:CEO Will Bryk 主张代理搜索需求将超过 Google 人类总量的数千倍。若代理成为主要网络客户端,检索层就是基建 —— 而 Exa 是 agent-first 打造,不是改造人类搜索引擎。
Exa 募 $2.5 亿 Series C、估值 $22 亿,由 a16z 领投 —— 较去年秋天 $7 亿估值 3 倍。AI 原生搜索 API(非 Google/Bing 包装),5,000+ 客户含 Cursor、Cognition、HubSpot。
为什么值得读 Anthropic 第一次做垂直市场产品。重点不在功能清单,而在「Claude for X」正式变成打包好的 SaaS 出货,而非单纯的模型 API。
Anthropic 推出 Claude for Small Business:15 套预建工作流、15 个 agent skills、12 个 SaaS 连接器(QuickBooks、PayPal、Square 等)。不额外收费。
Anthropic 推出 10 個現成可用的金融 agent 模板,搭配受治理的資料連接器(Moody's MCP、D&B、Fiscal AI、IBISWorld)。Claude Opus 4.7 在 Vals AI Finance Agent 基準以 64.37% 領先。
Picobot 5/9 推出 — 單一 9MB Go 二進位檔,閒置 10MB RAM、29MB Alpine Docker 映像。內建 16 個工具(檔案、shell、網路、cron、記憶、子代理)。可跑於 $5 VPS、Pi、舊 Android。
Opsera 在 Cursor IDE 内交付 3 个 DevSecOps 代理:架构校验、SQL/安全扫描、SOC2/HIPAA/PCI/GDPR 自动证据收集。
Bret Taylor 的 Sierra 以 158 亿美元投后估值募资 9.5 亿美元 — 服务 Fortune 50 中 40% 客户、8 个季度做到 1.5 亿美元 ARR。Tiger Global 与 Google GV 领投。
Snyk 在 AI 安全平台中嵌入 Claude 并发布 Evo — 首个面向提示注入、MCP 供应链攻击与代理工具调用的主流 AppSec 工具。
Anthropic 为 Managed Agents 发布机群编排、Outcomes 目标规范与 Dreaming。Dreaming 让代理无需微调即可跨会话自我改进。
Anthropic 发布 Claude Code Routines — 在 Anthropic 基础设施上运行的 (prompt, repo, connectors) 配置,由调度、HTTP POST 或 GitHub 事件触发。
Jules(由 Gemini 3 Pro 驱动)全球公开测试版上线,提供 GitHub 标签触发 Action 及全新「Jules Tools」CLI,是首个真正挑战 Claude Code 的异步 GitHub 原生编程 Agent。
OX Security 披露超过 20 万台 MCP 服务器因 STDIO 传输层缺乏输入消毒允许任意 OS 命令执行;另一项扫描发现 36.7% 的服务器存在 SSRF 漏洞。
Agent 365 以每用户 $15 正式推出,每个 Agent 拥有独立 Entra 身份与 Defender MCP 威胁检测;Agent Framework 1.0 提供内置 A2A 与 MCP 互通的开源多 Agent 协作基础。
Mistral Medium 3.5 是 128B 參数密集模型、256K context。Mistral 同时为 Vibe 加入云端 remote agent 與 Le Chat 的 Work Mode。
Anthropic 给 69 位员工 $100 预算,讓 agent 在四个不同模型设置的市集互买互卖,共 186 筆交易、約 $4K 流动,且模型质量造成明显不对称。
Cursor 3.2 加入 /multitask 並行 async subagent、Agents Window 的 worktrees、跨多个文件夹/repo 的 multi-root workspace。
Google 在 Gemini API 推出兩个由 Gemini 3.1 Pro 驱动的研究 agent:低延迟 Deep Research 與长運算 Deep Research Max,皆原生支援 Model Context Protocol。