Skip to content
AI-Daily-Builder

arXiv 論文

精選近期 LLM 前沿論文,附上實戰筆記告訴你哪些值得用、哪些可略過。

已收錄論文數
20
主題聚焦: LLM 前沿 · 代理 · RL · 多模態
本月
0
本月已收錄論文
月均
3.3
近 6 個月平均
最新論文
2026-06-11
最近一次收錄
每月論文收錄數
NaN NaN NaN
arXiv 2606.13672

WEAVER:同時達成高保真度、長時域一致性與快速推理的機器人操作世界模型(CMU)

Jain, Wu, Farebrother, et al.

WEAVER(CMU)是一種用於機器人操作的習得世界模型,解決了保真度-一致性-速度三難困境:在單一架構中實現高精度、長時域連貫性與即時推理,以最少的真實世界互動實現策略評估與測試時規劃。

roboticsreasoninginferenceagentsarchitecture
arXiv 2606.11854

ART:以強化學習優化視覺軟標記,在不更新權重的情況下微調凍結多模態大型語言模型

Chudoba et al., Alyaev, Galuscakova, et al.

ART 透過優化原始視覺輸入標記(而非模型權重),微調凍結的多模態 LLM,使 RL 適配能在 vLLM 等預編譯推理圖上執行。對凍結主幹的視覺軟標記進行強化訓練,無需任何權重更新即可實現有效的任務適配。

multimodaltrainingefficiencyrlvision
arXiv 2606.09659

Latent Context Language Models:以 350B token 訓練的 encoder-decoder 壓縮擊敗 KV-cache 剪枝——16 倍壓縮下 GSM8K 仍有 81%,基線方法掉到 0%

Ang Li, Sean McLeish, Haozhe Chen, et al.

一支橫跨 Goldstein、Goldblum 與 Izmailov 團隊的 15 人作者群,把 encoder-decoder 上下文壓縮重新做到規模化:0.6B 編碼器加 4B 解碼器,以約 350B token 訓練,刷出速度/記憶體/準確率的新帕雷托前沿,模型與程式碼全數開源。

kv-cachecontext-compressionllm-inferencelong-contextencoder-decoder
arXiv 2606.04127

「當檢索幫不上忙」:一項涵蓋 5 個模型、10 個資料集的生醫 RAG 研究發現,增益僅 1-2 分——而骨幹模型比檢索器更重要

Erfan Nourbakhsh, Rocky Slavin, Ke Yang, et al.

一項新的 arXiv 研究橫掃 5 個開放權重模型、10 個生醫問答資料集、4 種檢索器與 4 個語料庫,發現 RAG 相較於無檢索基線僅多出 1-2 分。骨幹模型比檢索器更重要——對任何想在 LLM 上硬掛 RAG 的人都是一記警鐘。

ragretrieval-augmented-generationllmbiomedical-nlpevaluation
arXiv 2606.04302

LazyAttention:與位置無關的 KV 重用,解開 RAG 快取瓶頸

Haocheng Xia, Mihir Pamnani, Hanxi Fang, et al.

ICML 2026 的一篇新論文 LazyAttention(arXiv:2606.04302)處理了 KV 快取在檢索增強生成中的一項頑固限制:由於位置資訊被烘焙進快取,在某個位置快取的區塊無法在另一個位置重用。作者將位置編碼延後到注意力核心本身執行,讓單一份實體 KV 副本能服務多個邏輯位置,且零複製。在偏斜的文件工作負載上,他們回報相較於 Block-Attention,首字延遲(TTFT)快 1.37x、吞吐量高 1.40x,且品質相當。

arxivragkv-cachellm-inferenceattention
arXiv 2606.02907

你的「推理探針」可能只是在讀格式:一個 arXiv 的警示性結果

Subramanyam Sahoo, Vinija Jain, Aman Chadha, et al.

一篇新的 arXiv 論文(2606.02907)顯示,在 Qwen3-14B 隱藏狀態中以 100% 準確率區分演繹、歸納與溯因推理的線性探針,一旦你控制了任務格式的混淆因素(如來源資料集、選項數量與回應長度),準確率便會崩落至隨機水準。重點是:能對某個標籤進行分類的探針,並不能證明模型內部表徵了那個概念。

interpretabilitylinear-probingllmreasoningmechanistic-interpretability
arXiv 2605.16941

Roll Out and Roll Back:讓擴散式 LLM 撤回自己的錯誤,達成 6x 更快的解碼

Fanqin Zeng, Feng Hong, Geng Yu, et al.

一篇新的 arXiv 論文提出 WINO,一種免訓練的擴散式語言模型解碼技巧:一次草擬大量 token,再驗證並重新遮蔽不可靠的部分。論文回報在 GSM8K 上去噪步數最多減少 6.1x,而準確率反而從 73.24% 上升到 75.82%,另有一個可選的微調變體能再進一步提升。

diffusion-llminference-efficiencyparallel-decodingarxivnlp
arXiv 2605.06285

LatentRAG 把 agentic RAG 推理移進 latent space,推理延遲砍掉約 90%

Yijia Zheng, Marcel Worring

arXiv 新論文 LatentRAG 把 agentic RAG 的多步推理與查詢生成,從逐字 token 的文字搬進連續的 latent space,準確度追平顯式代理,同時把推理延遲砍掉約 90%。

ragagentslatent-reasoninginference-efficiencyretrieval
arXiv 2605.08083

AutoTTS —— LLM 代理用 $39.90 自己發現 test-time scaling 策略

Tong Zheng, Haolin Liu, Chengsong Huang, et al.

AutoTTS 把 test-time scaling 重構成 controller-synthesis 問題:LLM 代理自己發現何時 branch、continue、probe、prune、stop —— 取代手調 best-of-N。整個發現迴圈花 $39.90 / 160 分鐘,在準確度-成本權衡上勝過手調基準。

test-time-scalingagentsinference-efficiencyrlreasoning
arXiv 2605.06208

代理上下文衰減:為何多工具代理在 7 次呼叫後失去連貫性

Jin Park, Aldous Foster, Maya Sundaram, et al.

多步代理連貫性的實證界限:成功率在 Claude 4.7、GPT-5、Gemini 3 Pro 上於第 7 次工具呼叫時急劇下降。透過工具軌跡摘要的緩解措施可恢復大部分損失。

agentstool-useclaudeopenaigemini
arXiv 2605.05117

Prompt 快取經濟:73% 的 LLM 成本隱藏在可快取前綴中

Hyeonji Lee, Tara Mukherjee, Daniel Roa-Bell

1,400 萬筆生產 LLM 請求的軌跡分析:73% 的輸入 token 在 5 分鐘窗口內跨請求重複。量化跨供應商的 prompt 快取成本節省 — Anthropic 5 分鐘 TTL 捕獲 81% 的節省。

prompt-cachinginferencecostanthropicopenai
arXiv 2605.04421

量化 MCP 供應鏈:20 萬個公開伺服器,14% 易受工具劫持攻擊

Sasha Rubinstein, Mira Wong, Ali Akbarian, et al.

對 npm/PyPI 註冊表中 200,073 個公開 MCP 伺服器的實證掃描:14.3% 暴露的工具描述易受 prompt 注入劫持;4.8% 在未過濾日誌中洩漏憑證。首個量化 MCP 威脅模型。

mcpsecurityagentssupply-chainprompt-injection
arXiv 2604.24763

Tuna-2:pixel embedding 在多模態理解上贏過 vision encoder

Zhiheng Liu, Weiming Ren, Xiaoke Huang

原生統一多模態模型,影像直接用 patch embedding 編碼 — 無 VAE、無獨立 vision encoder。在規模化下細粒度感知獲勝。

multimodalvisionarchitecture
arXiv 2604.22074

結果型獎勵不保證推理過程可驗證或因果重要

Qinan Yu, Alexa Tartaglini, Peter Hase

提出 CIR(推理因果重要性)與 SR(推理充分性)兩個指標。RLVR 改善正確率但未必改善 CIR 或 SR。

rlvrreasoningcausalitysafety
arXiv 2604.19295

TEMPO:為大型 reasoning 模型擴展 test-time training

Qingyang Zhang, Xinke Kong, Haitao Wu

Test-time training 框架,policy 在未標註題目上精煉、critic 在標註資料上週期性校準。OLMO3-7B 在 AIME 2024 從 33.0% 升到 51.1%。

tttreasoningrlvr
arXiv 2604.18788

NPUMoE:Apple Silicon NPU 上的高效 MoE LLM 推論

Afsara Benazir, Felix Xiaozhu Lin

Runtime 透過離線校準、靜態容量層級、load-aware graph 駐留處理 MoE 在 NPU 上的不適配。M 系列晶片上延遲降 1.32-5.55 倍。

mlxapple-siliconmoeinferenceon-device
arXiv 2604.16529

為 agentic coding 擴展 test-time compute

Joongwon Kim, Wannan Yang, Kelvin Niu

主張長 horizon coding agent 的 test-time scaling 是「表示問題」而非「取樣問題」。Claude Opus 4.5 在 SWE-Bench Verified 從 70.9% 升到 77.6%。

agentsttccodingfrontier
arXiv 2604.13120

AgentForge:以執行驗證為核心的多代理 SWE 框架

Rajesh Kumar, Waqar Ali, Junaid Ahmed

把「執行驗證」當作一等原則:每次 code 變更都要先在 Docker sandbox 中運行通過才能傳遞。SWE-Bench Lite 達 40.0%。

agentsswemulti-agentsandbox
arXiv 2604.12710

LASA:在語意瓶頸層做語言無關的安全對齊

Junxiao Yang, Haoran Liu, Jinzhe Tu

辨識出一個語言中性的「語意瓶頸」層。把對齊錨定在這層,LLaMA-3.1-8B 攻擊成功率從 24.7% 降到 2.8%。

safetymultilingualalignmentjailbreak
arXiv 2604.10261

The Amazing Agent Race:工具呼叫強,網頁導航弱

Zae Myung Kim, Dongseok Lee, Jaehyung Kim

用 Wikipedia DAG 拼圖建立 benchmark。1,400 案例三套 framework 下最佳系統 37.2%。導航錯誤主導(27-52%),工具呼叫錯誤 <17%。

agentsbenchmarknavigationtool-use
請喝咖啡