大型語言模型智能體中的跨任務技能遷移:子任務與文本勝出
為什麼值得讀 開發自主智能體的開發人員可以通過將記憶體結構化為文本形式的子任務來提高可靠性。所提出的效用評分提供了一種執行前的診斷工具,用於篩選有效的技能。
研究發現,子任務級別的歸納與文本格式能使大型語言模型智能體實現可靠的技能遷移,其表現優於任務級別和基於代碼的方法。
為什麼值得讀 開發自主智能體的開發人員可以通過將記憶體結構化為文本形式的子任務來提高可靠性。所提出的效用評分提供了一種執行前的診斷工具,用於篩選有效的技能。
研究發現,子任務級別的歸納與文本格式能使大型語言模型智能體實現可靠的技能遷移,其表現優於任務級別和基於代碼的方法。
為什麼值得讀 本研究顯示,專為強大代理工具使用而設計的中期訓練至關重要,為僅依賴後期訓練方法的大型語言模型提供了更優的替代方案。
MidTool 引入中期訓練流程,結合網路資料與合成 API 監督,顯著提升 Qwen3 模型的通用工具使用能力。
為什麼值得讀 模型已就緒,政策卻還沒跟上。前沿模型發布卡在政府審批而非 OpenAI 產能上,這是開發者該預期會再次看到的新治理模式。
OpenAI 於 6 月 26 日發布 GPT-5.6 Sol/Terra/Luna——Sol 在 Terminal-Bench 2.1 拿下 91.9%,但存取權僅限約 20 家獲美國政府核准的合作夥伴。
為什麼值得讀 開源權重與前沿閉源模型的差距,如今只能用個位數的基準分數來衡量。對自架部署的開發者而言,GLM-5.2 改寫了代理式編程「自建 vs 採購」的算式。
Z.ai 於 6 月 17 日以 MIT 授權釋出 GLM-5.2——一款 7,530 億參數的 MoE 模型,具 100 萬 token 上下文,登頂開源編程基準,成本約僅 GPT-5.5 的六分之一。
為什麼值得讀 定價與免費試用期是開發者最該先確認的兩件事。以每百萬 token 輸入 $15/輸出 $60 的定價,Pro 是被設計來認真使用的,不是拿來試用的。
Gemini 3.5 Pro 進入最終 Vertex 企業版預覽,具備 200 萬 token 上下文視窗與 Deep Think 推理;GA 正式發布預計在 2026 年 6 月即將到來。
為什麼值得讀 一個前沿模型、兩種發布:有安全護欄的公開版,與受限的完整版。定價、免費期間與安全分類器回退機制,是開發者最該先確認的三件事。
Anthropic 發布 Claude Fable 5——首個公開可用的 Mythos 級模型,定價每百萬 token 輸入 $10/輸出 $50;解除限制的 Mythos 5 僅開放給審核過的合作夥伴。
為什麼值得讀 如果你成天泡在 GitHub Copilot 裡,本週游標下的預設模型可能已悄悄換掉了。以下是實際推出的內容,以及如何辨認。
微軟在 Build 2026 把一個 5B 自研程式碼模型放進 VS Code,並推出一個 35B 推理模型——兩者都未經 OpenAI 蒸餾訓練。
為什麼值得讀 一個大型平台擁有者推出自家推理模型,並公開將其框定為少付 OpenAI 費用的途徑,這是一個結構性的故事,而不只是一次產品發布——它為整個前沿模型供應鏈重新定價。
在 6 月 2 日的 Build 2026 上,微軟發布七款從零打造的 MAI 模型,由推理模型 MAI-Thinking-1 領銜,以降低成本並減少對 OpenAI 的依賴。
四家中國實驗室在 12 天內相繼推出前沿等級編碼模型。GLM-5.1 以 MIT 授權在 SWE-Bench Pro 達 58.4%,與 Kimi K2.6 並列最高。API 成本比西方前沿模型低 5–25 倍。