Skip to content
AI-Daily-Builder

arXiv 论文

精选近期 LLM 前沿论文,附上实战笔记告诉你哪些值得用、哪些可略过。

已收录论文数
20
主题聚焦: LLM 前沿 · 代理 · RL · 多模态
本月
0
本月已收录论文
月均
3.3
近 6 个月平均
最新论文
2026-06-11
最近一次收录
每月论文收录数
NaN NaN NaN
arXiv 2606.13672

WEAVER:同时实现高保真度、长时域一致性与快速推理的机器人操作世界模型(CMU)

Jain, Wu, Farebrother, et al.

WEAVER(CMU)是一种用于机器人操作的习得世界模型,解决了保真度-一致性-速度三难困境:在单一架构中实现高精度、长时域连贯性与实时推理,以最少的真实世界交互实现策略评估与测试时规划。

roboticsreasoninginferenceagentsarchitecture
arXiv 2606.11854

ART:以强化学习优化视觉软标记,在不更新权重的情况下微调冻结多模态大型语言模型

Chudoba et al., Alyaev, Galuscakova, et al.

ART 通过优化原始视觉输入标记(而非模型权重),微调冻结的多模态 LLM,使 RL 适配能在 vLLM 等预编译推理图上执行。对冻结主干的视觉软标记进行强化训练,无需任何权重更新即可实现有效的任务适配。

multimodaltrainingefficiencyrlvision
arXiv 2606.09659

Latent Context Language Models:用 350B token 训练的 encoder-decoder 压缩击败 KV-cache 剪枝——16 倍压缩下 GSM8K 仍达 81%,基线方法跌到 0%

Ang Li, Sean McLeish, Haozhe Chen, et al.

一支横跨 Goldstein、Goldblum 与 Izmailov 团队的 15 人作者群,把 encoder-decoder 上下文压缩重新做到规模化:0.6B 编码器加 4B 解码器,用约 350B token 训练,刷出速度/内存/准确率的新帕累托前沿,模型与代码全部开源。

kv-cachecontext-compressionllm-inferencelong-contextencoder-decoder
arXiv 2606.04127

「当检索帮不上忙」:一项涵盖 5 个模型、10 个数据集的生医 RAG 研究发现,增益仅 1-2 分——而骨干模型比检索器更重要

Erfan Nourbakhsh, Rocky Slavin, Ke Yang, et al.

一项新的 arXiv 研究横扫 5 个开放权重模型、10 个生医问答数据集、4 种检索器与 4 个语料库,发现 RAG 相较于无检索基线仅多出 1-2 分。骨干模型比检索器更重要——对任何想在 LLM 上硬挂 RAG 的人都是一记警钟。

ragretrieval-augmented-generationllmbiomedical-nlpevaluation
arXiv 2606.04302

LazyAttention:与位置无关的 KV 重用,解开 RAG 缓存瓶颈

Haocheng Xia, Mihir Pamnani, Hanxi Fang, et al.

ICML 2026 的一篇新论文 LazyAttention(arXiv:2606.04302)处理了 KV 缓存在检索增强生成中的一项顽固限制:由于位置信息被烘焙进缓存,在某个位置缓存的块无法在另一个位置重用。作者将位置编码延后到注意力核心本身执行,让单一份物理 KV 副本能服务多个逻辑位置,且零复制。在偏斜的文档工作负载上,他们报告相较于 Block-Attention,首字延迟(TTFT)快 1.37x、吞吐量高 1.40x,且质量相当。

arxivragkv-cachellm-inferenceattention
arXiv 2606.02907

你的「推理探针」可能只是在读格式:一个 arXiv 的警示性结果

Subramanyam Sahoo, Vinija Jain, Aman Chadha, et al.

一篇新的 arXiv 论文(2606.02907)显示,在 Qwen3-14B 隐藏状态中以 100% 准确率区分演绎、归纳与溯因推理的线性探针,一旦你控制了任务格式的混淆因素(如来源数据集、选项数量与回应长度),准确率便会崩落至随机水平。重点是:能对某个标签进行分类的探针,并不能证明模型内部表征了那个概念。

interpretabilitylinear-probingllmreasoningmechanistic-interpretability
arXiv 2605.16941

Roll Out and Roll Back:让扩散式 LLM 撤回自己的错误,实现 6x 更快的解码

Fanqin Zeng, Feng Hong, Geng Yu, et al.

一篇新的 arXiv 论文提出 WINO,一种免训练的扩散式语言模型解码技巧:一次草拟大量 token,再验证并重新遮蔽不可靠的部分。论文报告在 GSM8K 上去噪步数最多减少 6.1x,而准确率反而从 73.24% 上升到 75.82%,另有一个可选的微调变体能再进一步提升。

diffusion-llminference-efficiencyparallel-decodingarxivnlp
arXiv 2605.06285

LatentRAG 把 agentic RAG 推理搬进 latent space,推理延迟砍掉约 90%

Yijia Zheng, Marcel Worring

arXiv 新论文 LatentRAG 把 agentic RAG 的多步推理与查询生成,从逐字 token 的文本搬进连续的 latent space,准确度追平显式代理,同时把推理延迟砍掉约 90%。

ragagentslatent-reasoninginference-efficiencyretrieval
arXiv 2605.08083

AutoTTS —— LLM 代理用 $39.90 自己发现 test-time scaling 策略

Tong Zheng, Haolin Liu, Chengsong Huang, et al.

AutoTTS 把 test-time scaling 重构成 controller-synthesis 问题:LLM 代理自己发现何时 branch、continue、probe、prune、stop —— 取代手调 best-of-N。整个发现循环花 $39.90 / 160 分钟,在准确度-成本权衡上胜过手调基准。

test-time-scalingagentsinference-efficiencyrlreasoning
arXiv 2605.06208

代理上下文衰减:为何多工具代理在 7 次调用后失去连贯性

Jin Park, Aldous Foster, Maya Sundaram, et al.

多步代理连贯性的实证界限:成功率在 Claude 4.7、GPT-5、Gemini 3 Pro 上于第 7 次工具调用时急剧下降。通过工具轨迹摘要的缓解措施可恢复大部分损失。

agentstool-useclaudeopenaigemini
arXiv 2605.05117

Prompt 缓存经济:73% 的 LLM 成本隐藏在可缓存前缀中

Hyeonji Lee, Tara Mukherjee, Daniel Roa-Bell

1,400 万生产 LLM 请求的轨迹分析:73% 的输入 token 在 5 分钟窗口内跨请求重复。量化跨供应商的 prompt 缓存成本节省 — Anthropic 5 分钟 TTL 捕获 81% 的节省。

prompt-cachinginferencecostanthropicopenai
arXiv 2605.04421

量化 MCP 供应链:20 万个公开服务器,14% 易受工具劫持攻击

Sasha Rubinstein, Mira Wong, Ali Akbarian, et al.

对 npm/PyPI 注册表中 200,073 个公开 MCP 服务器的实证扫描:14.3% 暴露的工具描述易受 prompt 注入劫持;4.8% 在未过滤日志中泄漏凭据。首个量化 MCP 威胁模型。

mcpsecurityagentssupply-chainprompt-injection
arXiv 2604.24763

Tuna-2:pixel embedding 在多模态理解上赢过 vision encoder

Zhiheng Liu, Weiming Ren, Xiaoke Huang

原生统一多模态模型,图像直接用 patch embedding 编码 — 无 VAE、无独立 vision encoder。在规模化下细粒度感知获胜。

multimodalvisionarchitecture
arXiv 2604.22074

结果型奖励不保证推理过程可验证或因果重要

Qinan Yu, Alexa Tartaglini, Peter Hase

提出 CIR(推理因果重要性)与 SR(推理充分性)两个指标。RLVR 改善正确率但未必改善 CIR 或 SR。

rlvrreasoningcausalitysafety
arXiv 2604.19295

TEMPO:为大型 reasoning 模型扩展 test-time training

Qingyang Zhang, Xinke Kong, Haitao Wu

Test-time training 框架,policy 在未标注题目上精炼、critic 在标注数据上周期性校准。OLMO3-7B 在 AIME 2024 从 33.0% 升到 51.1%。

tttreasoningrlvr
arXiv 2604.18788

NPUMoE:Apple Silicon NPU 上的高效 MoE LLM 推论

Afsara Benazir, Felix Xiaozhu Lin

Runtime 通过离线校准、静态容量层级、load-aware graph 驻留处理 MoE 在 NPU 上的不适配。M 系列芯片上延迟降 1.32-5.55 倍。

mlxapple-siliconmoeinferenceon-device
arXiv 2604.16529

为 agentic coding 扩展 test-time compute

Joongwon Kim, Wannan Yang, Kelvin Niu

主张长 horizon coding agent 的 test-time scaling 是「表示问题」而非「采样问题」。Claude Opus 4.5 在 SWE-Bench Verified 从 70.9% 升到 77.6%。

agentsttccodingfrontier
arXiv 2604.13120

AgentForge:以执行验证为核心的多代理 SWE 框架

Rajesh Kumar, Waqar Ali, Junaid Ahmed

把「执行验证」当作一等原则:每次 code 变更都要先在 Docker sandbox 中运行通过才能传递。SWE-Bench Lite 达 40.0%。

agentsswemulti-agentsandbox
arXiv 2604.12710

LASA:在语义瓶颈层做语言无关的安全对齐

Junxiao Yang, Haoran Liu, Jinzhe Tu

辨识出一个语言中性的「语义瓶颈」层。把对齐锚定在这层,LLaMA-3.1-8B 攻击成功率从 24.7% 降到 2.8%。

safetymultilingualalignmentjailbreak
arXiv 2604.10261

The Amazing Agent Race:工具调用强,网页导航弱

Zae Myung Kim, Dongseok Lee, Jaehyung Kim

用 Wikipedia DAG 拼图建立 benchmark。1,400 案例三套 framework 下最佳系统 37.2%。导航错误主导(27-52%),工具调用错误 <17%。

agentsbenchmarknavigationtool-use
请喝咖啡