新方法使压缩的4位模型超越全精度版本
为什么值得读 开发者应关注此方法,因为它能恢复通常在压缩和量化过程中丢失的能力。
一种新的修复技术使压缩后的4位模型在七个基准测试中超越了其全精度原版,恢复了通常因压缩和量化而丢失的能力。
为什么值得读 开发者应关注此方法,因为它能恢复通常在压缩和量化过程中丢失的能力。
一种新的修复技术使压缩后的4位模型在七个基准测试中超越了其全精度原版,恢复了通常因压缩和量化而丢失的能力。
为什么值得读 构建自主智能体的开发者可以通过将记忆结构化为文本形式的子任务来提高可靠性。所提出的效用分数提供了一种执行前的诊断手段,用于筛选有效技能。
研究发现,基于子任务的归纳和文本格式能使大语言模型智能体实现可靠的技能迁移,其效果优于基于任务和代码的方法。
为什么值得读 这项研究表明,专用的中期训练对于稳健的智能体工具使用至关重要,为仅依赖后训练方法的 LLM 提供了更优的替代方案。
MidTool 引入了一种中期训练流程,通过结合网络数据与合成的 API 监督,显著提升了 Qwen3 模型在通用工具使用方面的能力。
为什么值得读 构建桌面智能体的人工智能工程师可以使用TMI从原始交互数据中学习真实世界的工作流,从而实现更稳健且可审计的任务执行。
新的TMI方法从被动计算机使用轨迹中提取结构化任务模型,显著提高了智能体相对于现有基线的准确性。该方法通过递归目标分解和控制流模型,从原始交互数据中恢复交错任务,在受控轨迹上实现0.974的一致性,并重建74.9%的执行步骤,使保留任务的准确性提高30.0%。
为什么值得读 美国首部全面的州级 AI 法律,还没生效就被改写。先立法、再在执行前因业界压力撤回的这套时间线,正是其他州值得留意的范本。
5 月 14 日签署的 SB 189 大幅削弱了科罗拉多州 AI 法案,将生效日期从 2026 年 6 月 30 日推迟到 2027 年 1 月 1 日,并改为仅披露制度。
为什么值得读 固定费率的 AI 编程工具,一直在用轻度自动补全用户去补贴重度智能体用户。Copilot 刚刚停止了这种补贴——而第一张账单,正是发布公告里所有人都跳过没看的那部分。
Copilot 于 6 月 1 日转为按 token 计费,6 月 30 日结束首个计费周期;重度智能体用户报告账单较旧的固定订阅费暴涨 10 到 50 倍。
为什么值得读 模型已经就绪,政策却还没跟上。一次由政府审批、而非 OpenAI 产能决定发布节奏的前沿模型发布,是开发者今后还会再见到的新治理模式。
OpenAI 于 6 月 26 日发布 GPT-5.6 Sol/Terra/Luna:Sol 在 Terminal-Bench 2.1 拿下 91.9%,但访问权限仅限约 20 家获美国政府批准的合作伙伴。
Aurora已在I-45启动无人驾驶商业货运。自驾卡车每英里节省的人力成本是出租车的10倍,市场规模是网约车的4倍,可能率先实现盈利。
对6500万无法开车的美国人——老年人、残障者、视障者——自动驾驶不是便利升级,而是独立自主的恢复。
自动驾驶车辆有望为3,000至4,000万名因残障或老化而无法驾车的美国人恢复行动自主——但前提是正确设计。
雨水破坏摄像头、雾气摧毁激光雷达、毫米波雷达几乎无惧天候——地理气候决定了无人驾驶出租车真正能落地的城市。
自动驾驶不只是特斯拉对Waymo。Aurora已启动无人卡车商业运营;Zoox仍在测试;Cruise在2023年事故后重建中。
乘车NPS、定价对比Uber/Lyft、采用曲线——消费者需求能否支撑自驾车规模目标的全面分析。
自动驾驶车辆是联网的计算机。大规模车队遭到攻击可致人死亡,并让实体 AI 投资逻辑倒退数年。
自动驾驶车网络安全全景:攻击面分析、研究记录的威胁类别、Tesla vs Waymo 防御架构,以及重大事件对整个产业的影响。
每辆自动驾驶车都是数据收集机器。谁拥有车队数据?机器人出租车竞赛背后藏着哪些变现模式?
特斯拉拥有数十亿英里的监督里程;Waymo拥有数千万英里完全无人驾驶里程。哪种数据类型能赢得AI训练竞赛?
Tesla收集数量,Waymo追求质量。哪个数据飞轮能在2028年前打造出更强的自动驾驶系统?AV投资人必读的结构性护城河比较。
探测警报声、为消防车让路、读取警察手势——紧急车辆交互是自动驾驶最难的边缘场景之一,并已引发真实监管行动。
全面分析Waymo、Tesla、Aurora等顶尖自驾车项目的烧钱速率、资金跑道与单位经济学,揭示谁能完成实体AI爬坡。