arXiv 논문
최근 LLM 프런티어 논문 선별 및 실전 활용/스킵 가이드.
WEAVER: 정확도·장기 일관성·고속 추론을 동시에 달성하는 로봇 조작용 세계 모델 (CMU)
WEAVER(CMU)는 로봇 조작을 위한 학습된 세계 모델로, 정확도-일관성-속도의 트릴레마를 해결한다. 단일 아키텍처에서 고정밀도·장기 일관성·실시간 추론을 실현하며, 최소한의 실제 환경 상호작용으로 정책 평가와 테스트 시 계획을 가능케 한다.
ART: 강화학습으로 시각 소프트 토큰을 최적화해 가중치 업데이트 없이 동결된 멀티모달 LLM을 파인튜닝
ART는 모델 가중치가 아닌 시각 입력 토큰만 최적화해 동결된 멀티모달 LLM을 파인튜닝하며, vLLM 같은 사전 컴파일 추론 그래프에서 RL 기반 적응을 가능케 한다. 동결 백본의 시각 소프트 토큰을 강화 훈련하면 가중치 업데이트 없이 효과적인 태스크 적응이 가능하다.
Latent Context Language Models: 350B 토큰으로 훈련한 encoder-decoder 압축이 KV-cache 프루닝을 제압——16배 압축에서도 GSM8K 81%, 베이스라인은 0%로 추락
Goldstein, Goldblum, Izmailov 그룹을 아우르는 15인 저자 팀이 encoder-decoder 방식의 컨텍스트 압축을 본격적인 스케일로 부활시켰다. 0.6B 인코더와 4B 디코더를 약 350B 토큰으로 훈련해 속도·메모리·정확도의 새로운 파레토 프런티어를 달성했고, 모델과 코드를 모두 공개했다.
"검색이 도움이 되지 않을 때": 5개 모델, 10개 데이터셋을 다룬 생의학 RAG 연구가 단 1~2점의 향상만을 발견 — 그리고 백본이 리트리버보다 더 중요하다
새로운 arXiv 연구가 오픈웨이트 모델 5개, 생의학 QA 데이터셋 10개, 리트리버 4종, 코퍼스 4개를 횡단 조사한 결과, RAG가 무검색 베이스라인 대비 단 1~2점만 더한다는 사실을 발견했다. 백본 모델이 리트리버보다 더 중요하다 — LLM에 RAG를 덧붙이는 누구에게나 정신이 번쩍 드는 결과다.
LazyAttention: 위치에 무관한 KV 재사용으로 RAG 캐시 병목을 풀다
ICML 2026의 새 논문 LazyAttention(arXiv:2606.04302)은 검색 증강 생성에서 KV 캐싱의 끈질긴 한계를 다룬다. 위치 정보가 캐시에 박혀 있기 때문에, 한 위치에서 캐시된 청크를 다른 위치에서 재사용할 수 없다. 저자들은 위치 인코딩을 어텐션 커널 자체로 미뤄, 하나의 물리적 KV 복사본이 복사 없이 여러 논리적 위치를 처리하게 한다. 치우친 문서 워크로드에서 그들은 Block-Attention 대비 첫 토큰까지의 시간이 1.37x 빠르고 처리량이 1.40x 높으며
당신의 "추론 프로브"는 단지 형식을 읽고 있을 뿐일지도 모른다: 경고를 던지는 arXiv 결과
새로운 arXiv 논문(2606.02907)은 Qwen3-14B의 은닉 상태에서 연역·귀납·가추 추론을 100% 정확도로 분리하는 선형 프로브가, 출처 데이터셋·선택지 수·응답 길이 같은 과제 형식 교란 요인을 통제하는 순간 우연 수준으로 무너진다는 것을 보여준다. 핵심은, 어떤 레이블을 분류해내는 프로브가 모델이 그 개념을 표상한다는 증거는 아니라는 것이다.
Roll Out and Roll Back: 확산 LLM이 자신의 실수를 철회하게 만들어 6배 빠른 디코딩 달성
새로운 arXiv 논문이 WINO를 제안한다. 이는 확산 언어 모델을 위한 학습이 필요 없는 디코딩 기법으로, 한 번에 많은 토큰을 초안 작성한 뒤 신뢰할 수 없는 것들을 검증하고 다시 마스킹한다. GSM8K에서 디노이징 단계를 최대 6.1배 줄이는 한편 정확도는 오히려 73.24%에서 75.82%로 상승했다고 보고하며, 선택적인 파인튜닝 변형은 더 나아간다.
LatentRAG, agentic RAG 추론을 잠재 공간으로 옮겨 추론 지연을 약 90% 절감
arXiv 신규 논문 LatentRAG는 agentic RAG의 다단계 추론과 쿼리 생성을 토큰 단위 텍스트에서 연속 잠재 공간으로 옮겨, 명시적 에이전트와 동등한 정확도를 유지하면서 추론 지연을 약 90% 절감한다.
AutoTTS —— LLM 에이전트가 $39.90로 자신의 test-time scaling 전략을 발견
AutoTTS는 test-time scaling을 controller-synthesis 문제로 재구성: LLM 에이전트가 branch·continue·probe·prune·stop 시점을 스스로 발견해 수동 튜닝 best-of-N을 대체. 발견 루프 전체가 $39.90 / 160분, 정확도-비용 트레이드오프에서 수동 베이스라인을 능가.
에이전트 컨텍스트 감쇠: 왜 멀티 툴 에이전트가 7회 호출 후 일관성을 잃는가
멀티 스텝 에이전트 일관성의 실증적 경계: 성공률이 Claude 4.7, GPT-5, Gemini 3 Pro에서 7번째 툴 호출에 급락. 툴 트레이스 요약을 통한 완화책이 손실 대부분을 회복.
프롬프트 캐시 경제: LLM 비용의 73%가 캐시 가능한 프리픽스에 숨어 있다
1,400만 프로덕션 LLM 요청 트레이스 분석: 입력 토큰의 73%가 5분 윈도우 내 요청 간 반복. 공급자 간 프롬프트 캐시 비용 절감 정량화 — Anthropic 5분 TTL이 절감의 81% 포착.
MCP 공급망 정량화: 20만 공개 서버 중 14%가 툴 하이재킹에 취약
npm/PyPI 레지스트리 200,073개 공개 MCP 서버 실증 스캔: 14.3%가 프롬프트 인젝션 하이재킹에 취약한 툴 설명 노출; 4.8%가 필터링되지 않은 로그에 자격증명 유출. 첫 정량적 MCP 위협 모델.
Tuna-2: pixel 임베딩이 멀티모달 이해에서 vision encoder를 이긴다
네이티브 통합 멀티모달 모델로, 이미지를 patch 임베딩으로 직접 인코딩합니다. VAE나 별도의 vision encoder가 없습니다. 스케일 업 시 세분화 인지에서 우세를 보입니다.
결과 보상은 추론 과정의 검증 가능성이나 인과적 중요성을 보장하지 않는다
CIR(추론의 인과적 중요성)과 SR(추론의 충분성)이라는 두 가지 지표를 제안합니다. RLVR은 정확도를 개선하지만 CIR이나 SR은 반드시 개선하지는 않습니다.
TEMPO: 대형 reasoning 모델을 위한 test-time training 확장
Test-time training 프레임워크로, policy는 라벨이 없는 문제 위에서 정제되고 critic은 라벨 데이터로 주기적으로 보정됩니다. OLMO3-7B는 AIME 2024에서 33.0%에서 51.1%로 상승했습니다.
NPUMoE: Apple Silicon NPU에서 효율적인 MoE LLM 추론
런타임이 오프라인 캘리브레이션, 정적 capacity tier, load-aware graph 상주를 통해 NPU 위 MoE의 부적합 문제를 해결합니다. M 시리즈 칩에서 지연 시간을 1.32~5.55배 줄였습니다.
에이전트 코딩을 위한 test-time compute 확장
장기 horizon 코딩 에이전트의 test-time scaling은 "샘플링 문제"가 아니라 "표현 문제"라고 주장합니다. Claude Opus 4.5는 SWE-Bench Verified에서 70.9%에서 77.6%로 상승했습니다.
AgentForge: 실행 검증을 핵심으로 하는 멀티 에이전트 SWE 프레임워크
"실행 검증"을 일등 원칙으로 도입했습니다. 모든 코드 변경은 Docker sandbox에서 통과한 뒤에야 다음으로 전달됩니다. SWE-Bench Lite 40.0%를 달성했습니다.
LASA: 시맨틱 보틀넥 레이어에서 언어 독립 안전 정렬
언어 중립적인 "시맨틱 보틀넥" 레이어를 식별했습니다. 정렬을 이 레이어에 앵커링하면 LLaMA-3.1-8B의 공격 성공률이 24.7%에서 2.8%로 낮아집니다.
The Amazing Agent Race: 도구 호출은 강하지만 웹 내비게이션은 약하다
Wikipedia DAG 퍼즐로 벤치마크를 구성했습니다. 1,400 케이스를 세 가지 framework에서 돌린 결과 최고 시스템이 37.2%였고, 내비게이션 오류가 27~52%로 지배적인 반면 도구 호출 오류는 17% 미만이었습니다.