任務模型誘導從電腦軌跡中恢復交錯工作流
為什麼值得讀 構建桌面智能體的 AI 工程師可利用 TMI 從原始互動數據中學習真實世界的工作流,從而實現更穩健且可審計的任務執行。
新的 TMI 方法從被動電腦使用軌跡中提取結構化任務模型,顯著提升了智能體相對於現有基準的準確率。
為什麼值得讀 構建桌面智能體的 AI 工程師可利用 TMI 從原始互動數據中學習真實世界的工作流,從而實現更穩健且可審計的任務執行。
新的 TMI 方法從被動電腦使用軌跡中提取結構化任務模型,顯著提升了智能體相對於現有基準的準確率。
為什麼值得讀 代理式編程的競爭,重心已從模型品質轉向執行環境。OpenAI 買下的是那些枯燥而困難的基礎設施——持久性、沙箱、稽核——它們才能把聰明的代理變成可部署的代理。
OpenAI 收購 Ona——前身為 Gitpod 的雲端開發環境公司——讓 Codex 代理能在持久、由客戶掌控、可稽核的環境中執行更長時間的任務。
為什麼值得讀 最關鍵的數據:一位客戶四個月內燒完整個 2026 年的 AI 預算。Ramp 正在為企業 AI 支出打造可觀測性與治理層——這個類別一年前幾乎不存在。
Ramp 於 6 月 4 日以 $440 億估值完成 $7.5 億 F 輪融資,押注 AI 代理將重塑企業支出管理,並推出全球首張專為 AI 代理設計的企業信用卡。
為什麼值得讀 我們略過了顯而易見的 MAI 模型頭條,因為 Build 2026 真正持久的故事是結構性的:微軟試圖讓接地後的情境成為預設的平台層,而非一個功能。請留意 Web IQ——一個低 token 的網路接地仲介者,對開放網路的影響遠超過它的企業說法。
Build 2026 較低調的平台動作:微軟把接地(grounding)技術整併成單一品牌 Microsoft IQ——Work IQ、Foundry IQ、Fabric IQ 與全新 Web IQ——把情境當成受管基礎設施,橫跨 Copilot 與 Foundry 出貨。
為什麼值得讀 約 53 倍的 ARR 倍數,押的是「代理即人力」,而非「代理即工具」。飛輪既是證明也是風險:Cognition 用 Devin 寫自家約 90% 的程式,所以它的成長故事與產品演示是同一回事——直到成長放緩。
Devin 程式代理的開發商 Cognition 以 260 億美元估值募資逾 10 億(5/27)——8 個月翻 2.5 倍、$492M ARR、自家程式約 90% 由 AI 撰寫。
為什麼值得讀 同一週,一個模型獵捕漏洞,Google 則推出自動修補漏洞的模型。當攻防都以機器速度運行,修補視窗從數週縮到數分鐘——而人類從操作者變成代理所寫修補的稽核者。
Google Cloud 推出 AI Threat Defense(5/27):以 Gemini 為核心,整合 Wiz、CodeMender 與 Mandiant,以機器速度發現並自動修補漏洞。
為什麼值得讀 賭注不是某個模型,而是凌駕所有模型之上的那一層。OpenRouter 賣的是選擇權:路由到最佳/最便宜的模型,不鎖定任何一家。看股東名單就懂——輝達加上 Snowflake、Databricks、MongoDB、ServiceNow 都想在路由層佔一席。
OpenRouter 完成由 CapitalG 領投的 1.13 億美元 B 輪(5/26),估值約 13 億;每月為 800 萬以上用戶在 400+ 模型間路由 100 兆 token——輝達與四家數據平台加入。
為什麼值得讀 搜尋列是新戰場。把會執行動作的代理嵌進使用者本就會打字的那個框——還推進 Teams 與 ChatGPT——Salesforce 押注護城河是 CRM 資料與工作流脈絡,而非聊天介面。介面正在商品化,資料不會。
Benioff 發表 Agentforce Coworker(5/21):駐進每個 Salesforce 搜尋列的 AI 隊友,存取即時 CRM 資料、能執行動作,並橫跨 Slack、Teams、ChatGPT。