arXiv 論文
精選近期 LLM 前沿論文,附上實戰筆記告訴你哪些值得用、哪些可略過。
WEAVER:同時達成高保真度、長時域一致性與快速推理的機器人操作世界模型(CMU)
WEAVER(CMU)是一種用於機器人操作的習得世界模型,解決了保真度-一致性-速度三難困境:在單一架構中實現高精度、長時域連貫性與即時推理,以最少的真實世界互動實現策略評估與測試時規劃。
ART:以強化學習優化視覺軟標記,在不更新權重的情況下微調凍結多模態大型語言模型
ART 透過優化原始視覺輸入標記(而非模型權重),微調凍結的多模態 LLM,使 RL 適配能在 vLLM 等預編譯推理圖上執行。對凍結主幹的視覺軟標記進行強化訓練,無需任何權重更新即可實現有效的任務適配。
Latent Context Language Models:以 350B token 訓練的 encoder-decoder 壓縮擊敗 KV-cache 剪枝——16 倍壓縮下 GSM8K 仍有 81%,基線方法掉到 0%
一支橫跨 Goldstein、Goldblum 與 Izmailov 團隊的 15 人作者群,把 encoder-decoder 上下文壓縮重新做到規模化:0.6B 編碼器加 4B 解碼器,以約 350B token 訓練,刷出速度/記憶體/準確率的新帕雷托前沿,模型與程式碼全數開源。
「當檢索幫不上忙」:一項涵蓋 5 個模型、10 個資料集的生醫 RAG 研究發現,增益僅 1-2 分——而骨幹模型比檢索器更重要
一項新的 arXiv 研究橫掃 5 個開放權重模型、10 個生醫問答資料集、4 種檢索器與 4 個語料庫,發現 RAG 相較於無檢索基線僅多出 1-2 分。骨幹模型比檢索器更重要——對任何想在 LLM 上硬掛 RAG 的人都是一記警鐘。
LazyAttention:與位置無關的 KV 重用,解開 RAG 快取瓶頸
ICML 2026 的一篇新論文 LazyAttention(arXiv:2606.04302)處理了 KV 快取在檢索增強生成中的一項頑固限制:由於位置資訊被烘焙進快取,在某個位置快取的區塊無法在另一個位置重用。作者將位置編碼延後到注意力核心本身執行,讓單一份實體 KV 副本能服務多個邏輯位置,且零複製。在偏斜的文件工作負載上,他們回報相較於 Block-Attention,首字延遲(TTFT)快 1.37x、吞吐量高 1.40x,且品質相當。
你的「推理探針」可能只是在讀格式:一個 arXiv 的警示性結果
一篇新的 arXiv 論文(2606.02907)顯示,在 Qwen3-14B 隱藏狀態中以 100% 準確率區分演繹、歸納與溯因推理的線性探針,一旦你控制了任務格式的混淆因素(如來源資料集、選項數量與回應長度),準確率便會崩落至隨機水準。重點是:能對某個標籤進行分類的探針,並不能證明模型內部表徵了那個概念。
Roll Out and Roll Back:讓擴散式 LLM 撤回自己的錯誤,達成 6x 更快的解碼
一篇新的 arXiv 論文提出 WINO,一種免訓練的擴散式語言模型解碼技巧:一次草擬大量 token,再驗證並重新遮蔽不可靠的部分。論文回報在 GSM8K 上去噪步數最多減少 6.1x,而準確率反而從 73.24% 上升到 75.82%,另有一個可選的微調變體能再進一步提升。
LatentRAG 把 agentic RAG 推理移進 latent space,推理延遲砍掉約 90%
arXiv 新論文 LatentRAG 把 agentic RAG 的多步推理與查詢生成,從逐字 token 的文字搬進連續的 latent space,準確度追平顯式代理,同時把推理延遲砍掉約 90%。
AutoTTS —— LLM 代理用 $39.90 自己發現 test-time scaling 策略
AutoTTS 把 test-time scaling 重構成 controller-synthesis 問題:LLM 代理自己發現何時 branch、continue、probe、prune、stop —— 取代手調 best-of-N。整個發現迴圈花 $39.90 / 160 分鐘,在準確度-成本權衡上勝過手調基準。
代理上下文衰減:為何多工具代理在 7 次呼叫後失去連貫性
多步代理連貫性的實證界限:成功率在 Claude 4.7、GPT-5、Gemini 3 Pro 上於第 7 次工具呼叫時急劇下降。透過工具軌跡摘要的緩解措施可恢復大部分損失。
Prompt 快取經濟:73% 的 LLM 成本隱藏在可快取前綴中
1,400 萬筆生產 LLM 請求的軌跡分析:73% 的輸入 token 在 5 分鐘窗口內跨請求重複。量化跨供應商的 prompt 快取成本節省 — Anthropic 5 分鐘 TTL 捕獲 81% 的節省。
量化 MCP 供應鏈:20 萬個公開伺服器,14% 易受工具劫持攻擊
對 npm/PyPI 註冊表中 200,073 個公開 MCP 伺服器的實證掃描:14.3% 暴露的工具描述易受 prompt 注入劫持;4.8% 在未過濾日誌中洩漏憑證。首個量化 MCP 威脅模型。
Tuna-2:pixel embedding 在多模態理解上贏過 vision encoder
原生統一多模態模型,影像直接用 patch embedding 編碼 — 無 VAE、無獨立 vision encoder。在規模化下細粒度感知獲勝。
結果型獎勵不保證推理過程可驗證或因果重要
提出 CIR(推理因果重要性)與 SR(推理充分性)兩個指標。RLVR 改善正確率但未必改善 CIR 或 SR。
TEMPO:為大型 reasoning 模型擴展 test-time training
Test-time training 框架,policy 在未標註題目上精煉、critic 在標註資料上週期性校準。OLMO3-7B 在 AIME 2024 從 33.0% 升到 51.1%。
NPUMoE:Apple Silicon NPU 上的高效 MoE LLM 推論
Runtime 透過離線校準、靜態容量層級、load-aware graph 駐留處理 MoE 在 NPU 上的不適配。M 系列晶片上延遲降 1.32-5.55 倍。
為 agentic coding 擴展 test-time compute
主張長 horizon coding agent 的 test-time scaling 是「表示問題」而非「取樣問題」。Claude Opus 4.5 在 SWE-Bench Verified 從 70.9% 升到 77.6%。
AgentForge:以執行驗證為核心的多代理 SWE 框架
把「執行驗證」當作一等原則:每次 code 變更都要先在 Docker sandbox 中運行通過才能傳遞。SWE-Bench Lite 達 40.0%。
LASA:在語意瓶頸層做語言無關的安全對齊
辨識出一個語言中性的「語意瓶頸」層。把對齊錨定在這層,LLaMA-3.1-8B 攻擊成功率從 24.7% 降到 2.8%。
The Amazing Agent Race:工具呼叫強,網頁導航弱
用 Wikipedia DAG 拼圖建立 benchmark。1,400 案例三套 framework 下最佳系統 37.2%。導航錯誤主導(27-52%),工具呼叫錯誤 <17%。