Skip to content
AI-Daily-Builder

标签 · #llm

大语言模型智能体中的跨任务技能迁移:子任务与文本胜出

为什么值得读 构建自主智能体的开发者可以通过将记忆结构化为文本形式的子任务来提高可靠性。所提出的效用分数提供了一种执行前的诊断手段,用于筛选有效技能。

研究发现,基于子任务的归纳和文本格式能使大语言模型智能体实现可靠的技能迁移,其效果优于基于任务和代码的方法。

OpenAI 预览 GPT-5.6 Sol、Terra、Luna:访问权限卡在美国政府审批关口

为什么值得读 模型已经就绪,政策却还没跟上。一次由政府审批、而非 OpenAI 产能决定发布节奏的前沿模型发布,是开发者今后还会再见到的新治理模式。

OpenAI 于 6 月 26 日发布 GPT-5.6 Sol/Terra/Luna:Sol 在 Terminal-Bench 2.1 拿下 91.9%,但访问权限仅限约 20 家获美国政府批准的合作伙伴。

智谱 AI 开源 GLM-5.2 权重:100 万 Token 上下文、顶尖开源编程模型,成本仅 GPT-5.5 的六分之一

为什么值得读 开源权重与前沿闭源模型的差距,如今只能用个位数的基准分数来衡量。对自托管的开发者而言,GLM-5.2 改写了智能体编程「自建 vs 采购」的算式。

Z.ai 于 6 月 17 日以 MIT 许可证发布 GLM-5.2——一款 7530 亿参数的 MoE 模型,具 100 万 token 上下文,登顶开源编程基准,成本约仅 GPT-5.5 的六分之一。

Google 将 Gemini 3.5 Pro 推入最终预览阶段:200 万 Token 上下文与 Deep Think 推理

为什么值得读 定价与免费试用期是开发者最该先确认的两件事。以每百万 token 输入 $15/输出 $60 的定价,Pro 是被设计来认真使用的,而非试用。

Gemini 3.5 Pro 进入最终 Vertex 企业版预览,具备 200 万 token 上下文窗口与 Deep Think 推理;GA 正式发布预计在 2026 年 6 月即将到来。

Anthropic 推出 Claude Fable 5:公众终于能用上的 Mythos 级前沿模型

为什么值得读 一个前沿模型、两种发布:带安全护栏的公开版,与受限的完整版。定价、免费窗口与安全分类器回退机制,是开发者最该先确认的三件事。

Anthropic 发布 Claude Fable 5——首个公开可用的 Mythos 级模型,定价每百万 token 输入 $10/输出 $50;解除限制的 Mythos 5 仅开放给经审核的合作伙伴。

微软推出七款自研 MAI 模型,包含首款推理模型,以降低对 OpenAI 的依赖

为什么值得读 一个大型平台拥有者推出自家推理模型,并公开将其框定为少付 OpenAI 费用的途径,这是一个结构性的故事,而不只是一次产品发布——它为整个前沿模型供应链重新定价。

在 6 月 2 日的 Build 2026 上,微软发布七款从零打造的 MAI 模型,由推理模型 MAI-Thinking-1 领衔,以降低成本并减少对 OpenAI 的依赖。

请喝咖啡