Skip to content
AI-Daily-Builder

標籤 · #llm

大型語言模型智能體中的跨任務技能遷移:子任務與文本勝出

為什麼值得讀 開發自主智能體的開發人員可以通過將記憶體結構化為文本形式的子任務來提高可靠性。所提出的效用評分提供了一種執行前的診斷工具,用於篩選有效的技能。

研究發現,子任務級別的歸納與文本格式能使大型語言模型智能體實現可靠的技能遷移,其表現優於任務級別和基於代碼的方法。

OpenAI 預覽 GPT-5.6 Sol、Terra、Luna——存取權卡在美國政府審查之後

為什麼值得讀 模型已就緒,政策卻還沒跟上。前沿模型發布卡在政府審批而非 OpenAI 產能上,這是開發者該預期會再次看到的新治理模式。

OpenAI 於 6 月 26 日發布 GPT-5.6 Sol/Terra/Luna——Sol 在 Terminal-Bench 2.1 拿下 91.9%,但存取權僅限約 20 家獲美國政府核准的合作夥伴。

智譜 AI 開源 GLM-5.2 權重:100 萬 Token 上下文、頂尖開源編程模型,成本僅 GPT-5.5 的六分之一

為什麼值得讀 開源權重與前沿閉源模型的差距,如今只能用個位數的基準分數來衡量。對自架部署的開發者而言,GLM-5.2 改寫了代理式編程「自建 vs 採購」的算式。

Z.ai 於 6 月 17 日以 MIT 授權釋出 GLM-5.2——一款 7,530 億參數的 MoE 模型,具 100 萬 token 上下文,登頂開源編程基準,成本約僅 GPT-5.5 的六分之一。

Google 將 Gemini 3.5 Pro 推入最終預覽階段:200 萬 Token 上下文與 Deep Think 推理

為什麼值得讀 定價與免費試用期是開發者最該先確認的兩件事。以每百萬 token 輸入 $15/輸出 $60 的定價,Pro 是被設計來認真使用的,不是拿來試用的。

Gemini 3.5 Pro 進入最終 Vertex 企業版預覽,具備 200 萬 token 上下文視窗與 Deep Think 推理;GA 正式發布預計在 2026 年 6 月即將到來。

Anthropic 推出 Claude Fable 5:大眾終於摸得到的 Mythos 級前沿模型

為什麼值得讀 一個前沿模型、兩種發布:有安全護欄的公開版,與受限的完整版。定價、免費期間與安全分類器回退機制,是開發者最該先確認的三件事。

Anthropic 發布 Claude Fable 5——首個公開可用的 Mythos 級模型,定價每百萬 token 輸入 $10/輸出 $50;解除限制的 Mythos 5 僅開放給審核過的合作夥伴。

微軟推出七款自研 MAI 模型,包含首款推理模型,以降低對 OpenAI 的依賴

為什麼值得讀 一個大型平台擁有者推出自家推理模型,並公開將其框定為少付 OpenAI 費用的途徑,這是一個結構性的故事,而不只是一次產品發布——它為整個前沿模型供應鏈重新定價。

在 6 月 2 日的 Build 2026 上,微軟發布七款從零打造的 MAI 模型,由推理模型 MAI-Thinking-1 領銜,以降低成本並減少對 OpenAI 的依賴。

請喝咖啡