大型語言模型智能體中的跨任務技能遷移:子任務與文本勝出
為什麼值得讀 開發自主智能體的開發人員可以通過將記憶體結構化為文本形式的子任務來提高可靠性。所提出的效用評分提供了一種執行前的診斷工具,用於篩選有效的技能。
研究發現,子任務級別的歸納與文本格式能使大型語言模型智能體實現可靠的技能遷移,其表現優於任務級別和基於代碼的方法。
為什麼值得讀 開發自主智能體的開發人員可以通過將記憶體結構化為文本形式的子任務來提高可靠性。所提出的效用評分提供了一種執行前的診斷工具,用於篩選有效的技能。
研究發現,子任務級別的歸納與文本格式能使大型語言模型智能體實現可靠的技能遷移,其表現優於任務級別和基於代碼的方法。
為什麼值得讀 主題是從「更好的模型」轉向「可靠的自主性」。Outcomes(評分代理執行的 grader loop)與 Dreaming(排程記憶整理)是「可放著無人看管執行的代理」的基建 —— 那才是企業代理部署的真正阻礙,不是模型 IQ。
在 Code with Claude 倫敦(5/20-21),Anthropic 推出 5 個代理功能 —— Dreaming、Outcomes、多代理協調、10 個代理的 Claude Finance、Add-ins —— 加上 Claude for Small Business 整合。
為什麼值得讀 論點是對量的真實押注:CEO Will Bryk 主張代理搜尋需求將超過 Google 人類總量的數千倍。若代理成為主要網路客戶端,檢索層就是基建 —— 而 Exa 是 agent-first 打造,不是改造人類搜尋引擎。
Exa 募 $2.5 億 Series C、估值 $22 億,由 a16z 領投 —— 較去年秋天 $7 億估值 3 倍。AI 原生搜尋 API(非 Google/Bing 包裝),5,000+ 客戶含 Cursor、Cognition、HubSpot。
為什麼值得讀 Anthropic 第一次做垂直市場產品。重點不在功能清單,而在「Claude for X」正式變成打包好的 SaaS 出貨,而非單純的模型 API。
Anthropic 推出 Claude for Small Business:15 套預建工作流、15 個 agent skills、12 個 SaaS 連接器(QuickBooks、PayPal、Square 等)。不額外收費。
Anthropic 推出 10 個現成可用的金融 agent 模板,搭配受治理的資料連接器(Moody's MCP、D&B、Fiscal AI、IBISWorld)。Claude Opus 4.7 在 Vals AI Finance Agent 基準以 64.37% 領先。
Picobot 5/9 推出 — 單一 9MB Go 二進位檔,閒置 10MB RAM、29MB Alpine Docker 映像。內建 16 個工具(檔案、shell、網路、cron、記憶、子代理)。可跑於 $5 VPS、Pi、舊 Android。
Opsera 在 Cursor IDE 內推出 3 個 DevSecOps agent:架構驗證、SQL/安全掃描、SOC2/HIPAA/PCI/GDPR 自動合規證據蒐集。
Bret Taylor 創辦的 Sierra 完成 $9.5 億 E 輪融資,估值 $158 億;8 個季度跨入 40% 財富 50 大企業,年化營收 $1.5 億。Tiger 與 GV 領投。
Snyk 將 Claude 嵌入其 AI 安全平台,推出 Evo —— 首個針對提示注入、MCP 供應鏈攻擊與 agent 工具呼叫的專用 AppSec 工具。
Anthropic 推出三項 Managed Agents 新基礎元件:多 agent 艦隊協作、Outcomes 目標導向迭代,以及 Dreaming——跨工作階段自我審查,無需微調即可提升 agent 能力。
Anthropic 推出 Claude Code Routines:以「prompt + repo + connectors」設定在 Anthropic 基礎設施上運行,支援排程、HTTP POST 或 GitHub 事件觸發。
Jules(由 Gemini 3 Pro 驅動)全球公開測試版上線,提供 GitHub 標籤觸發 Action 及全新「Jules Tools」CLI,是首個正式挑戰 Claude Code 的非同步 GitHub 原生程式 Agent。
OX Security 披露超過 20 萬台 MCP 伺服器因未對 STDIO 傳輸層輸入做消毒,允許任意 OS 命令執行;另一項掃描發現 36.7% 的伺服器存在 SSRF 漏洞。
Agent 365 以每位使用者 $15 美元正式推出,每個 Agent 擁有獨立 Entra 身份、Purview 標籤與 Defender MCP 威脅偵測;Agent Framework 1.0 提供內建 A2A 與 MCP 互通的開源多 Agent 協作基礎。
Mistral Medium 3.5 是 128B 參數密集模型、256K context。Mistral 同時為 Vibe 加入雲端 remote agent 與 Le Chat 的 Work Mode。
Anthropic 給 69 位員工 $100 預算,讓 agent 在四個不同模型設定的市集互買互賣,共 186 筆交易、約 $4K 流動,且模型品質造成明顯不對稱。
Cursor 3.2 加入 /multitask 並行 async subagent、Agents Window 的 worktrees、跨多個資料夾/repo 的 multi-root workspace。
Google 在 Gemini API 推出兩個由 Gemini 3.1 Pro 驅動的研究 agent:低延遲 Deep Research 與長運算 Deep Research Max,皆原生支援 Model Context Protocol。