Skip to content
AI-Daily-Builder

历史

大语言模型智能体中的跨任务技能迁移:子任务与文本胜出

为什么值得读 构建自主智能体的开发者可以通过将记忆结构化为文本形式的子任务来提高可靠性。所提出的效用分数提供了一种执行前的诊断手段,用于筛选有效技能。

研究发现,基于子任务的归纳和文本格式能使大语言模型智能体实现可靠的技能迁移,其效果优于基于任务和代码的方法。

任务模型诱导从计算机轨迹中恢复交错工作流

为什么值得读 构建桌面智能体的人工智能工程师可以使用TMI从原始交互数据中学习真实世界的工作流,从而实现更稳健且可审计的任务执行。

新的TMI方法从被动计算机使用轨迹中提取结构化任务模型,显著提高了智能体相对于现有基线的准确性。该方法通过递归目标分解和控制流模型,从原始交互数据中恢复交错任务,在受控轨迹上实现0.974的一致性,并重建74.9%的执行步骤,使保留任务的准确性提高30.0%。

科罗拉多州 AI 法案本该今天生效,结果要拖到 2027 年

为什么值得读 美国首部全面的州级 AI 法律,还没生效就被改写。先立法、再在执行前因业界压力撤回的这套时间线,正是其他州值得留意的范本。

5 月 14 日签署的 SB 189 大幅削弱了科罗拉多州 AI 法案,将生效日期从 2026 年 6 月 30 日推迟到 2027 年 1 月 1 日,并改为仅披露制度。

GitHub Copilot 结束首个按量计费周期:重度智能体用户感受到了冲击

为什么值得读 固定费率的 AI 编程工具,一直在用轻度自动补全用户去补贴重度智能体用户。Copilot 刚刚停止了这种补贴——而第一张账单,正是发布公告里所有人都跳过没看的那部分。

Copilot 于 6 月 1 日转为按 token 计费,6 月 30 日结束首个计费周期;重度智能体用户报告账单较旧的固定订阅费暴涨 10 到 50 倍。

OpenAI 预览 GPT-5.6 Sol、Terra、Luna:访问权限卡在美国政府审批关口

为什么值得读 模型已经就绪,政策却还没跟上。一次由政府审批、而非 OpenAI 产能决定发布节奏的前沿模型发布,是开发者今后还会再见到的新治理模式。

OpenAI 于 6 月 26 日发布 GPT-5.6 Sol/Terra/Luna:Sol 在 Terminal-Bench 2.1 拿下 91.9%,但访问权限仅限约 20 家获美国政府批准的合作伙伴。

请喝咖啡