Skip to content
AI-Daily-Builder

arXiv 논문

최근 LLM 프런티어 논문 선별 및 실전 활용/스킵 가이드.

수록 논문 수
20
주제: LLM 프런티어 · 에이전트 · RL · 멀티모달
이번 달
0
이번 달 수록 논문 수
월 평균
3.3
최근 6개월 평균
최신 논문
2026-06-11
최근 수록
월별 논문 수록 수
NaN NaN NaN
arXiv 2606.13672

WEAVER: 정확도·장기 일관성·고속 추론을 동시에 달성하는 로봇 조작용 세계 모델 (CMU)

Jain, Wu, Farebrother, et al.

WEAVER(CMU)는 로봇 조작을 위한 학습된 세계 모델로, 정확도-일관성-속도의 트릴레마를 해결한다. 단일 아키텍처에서 고정밀도·장기 일관성·실시간 추론을 실현하며, 최소한의 실제 환경 상호작용으로 정책 평가와 테스트 시 계획을 가능케 한다.

roboticsreasoninginferenceagentsarchitecture
arXiv 2606.11854

ART: 강화학습으로 시각 소프트 토큰을 최적화해 가중치 업데이트 없이 동결된 멀티모달 LLM을 파인튜닝

Chudoba et al., Alyaev, Galuscakova, et al.

ART는 모델 가중치가 아닌 시각 입력 토큰만 최적화해 동결된 멀티모달 LLM을 파인튜닝하며, vLLM 같은 사전 컴파일 추론 그래프에서 RL 기반 적응을 가능케 한다. 동결 백본의 시각 소프트 토큰을 강화 훈련하면 가중치 업데이트 없이 효과적인 태스크 적응이 가능하다.

multimodaltrainingefficiencyrlvision
arXiv 2606.09659

Latent Context Language Models: 350B 토큰으로 훈련한 encoder-decoder 압축이 KV-cache 프루닝을 제압——16배 압축에서도 GSM8K 81%, 베이스라인은 0%로 추락

Ang Li, Sean McLeish, Haozhe Chen, et al.

Goldstein, Goldblum, Izmailov 그룹을 아우르는 15인 저자 팀이 encoder-decoder 방식의 컨텍스트 압축을 본격적인 스케일로 부활시켰다. 0.6B 인코더와 4B 디코더를 약 350B 토큰으로 훈련해 속도·메모리·정확도의 새로운 파레토 프런티어를 달성했고, 모델과 코드를 모두 공개했다.

kv-cachecontext-compressionllm-inferencelong-contextencoder-decoder
arXiv 2606.04127

"검색이 도움이 되지 않을 때": 5개 모델, 10개 데이터셋을 다룬 생의학 RAG 연구가 단 1~2점의 향상만을 발견 — 그리고 백본이 리트리버보다 더 중요하다

Erfan Nourbakhsh, Rocky Slavin, Ke Yang, et al.

새로운 arXiv 연구가 오픈웨이트 모델 5개, 생의학 QA 데이터셋 10개, 리트리버 4종, 코퍼스 4개를 횡단 조사한 결과, RAG가 무검색 베이스라인 대비 단 1~2점만 더한다는 사실을 발견했다. 백본 모델이 리트리버보다 더 중요하다 — LLM에 RAG를 덧붙이는 누구에게나 정신이 번쩍 드는 결과다.

ragretrieval-augmented-generationllmbiomedical-nlpevaluation
arXiv 2606.04302

LazyAttention: 위치에 무관한 KV 재사용으로 RAG 캐시 병목을 풀다

Haocheng Xia, Mihir Pamnani, Hanxi Fang, et al.

ICML 2026의 새 논문 LazyAttention(arXiv:2606.04302)은 검색 증강 생성에서 KV 캐싱의 끈질긴 한계를 다룬다. 위치 정보가 캐시에 박혀 있기 때문에, 한 위치에서 캐시된 청크를 다른 위치에서 재사용할 수 없다. 저자들은 위치 인코딩을 어텐션 커널 자체로 미뤄, 하나의 물리적 KV 복사본이 복사 없이 여러 논리적 위치를 처리하게 한다. 치우친 문서 워크로드에서 그들은 Block-Attention 대비 첫 토큰까지의 시간이 1.37x 빠르고 처리량이 1.40x 높으며

arxivragkv-cachellm-inferenceattention
arXiv 2606.02907

당신의 "추론 프로브"는 단지 형식을 읽고 있을 뿐일지도 모른다: 경고를 던지는 arXiv 결과

Subramanyam Sahoo, Vinija Jain, Aman Chadha, et al.

새로운 arXiv 논문(2606.02907)은 Qwen3-14B의 은닉 상태에서 연역·귀납·가추 추론을 100% 정확도로 분리하는 선형 프로브가, 출처 데이터셋·선택지 수·응답 길이 같은 과제 형식 교란 요인을 통제하는 순간 우연 수준으로 무너진다는 것을 보여준다. 핵심은, 어떤 레이블을 분류해내는 프로브가 모델이 그 개념을 표상한다는 증거는 아니라는 것이다.

interpretabilitylinear-probingllmreasoningmechanistic-interpretability
arXiv 2605.16941

Roll Out and Roll Back: 확산 LLM이 자신의 실수를 철회하게 만들어 6배 빠른 디코딩 달성

Fanqin Zeng, Feng Hong, Geng Yu, et al.

새로운 arXiv 논문이 WINO를 제안한다. 이는 확산 언어 모델을 위한 학습이 필요 없는 디코딩 기법으로, 한 번에 많은 토큰을 초안 작성한 뒤 신뢰할 수 없는 것들을 검증하고 다시 마스킹한다. GSM8K에서 디노이징 단계를 최대 6.1배 줄이는 한편 정확도는 오히려 73.24%에서 75.82%로 상승했다고 보고하며, 선택적인 파인튜닝 변형은 더 나아간다.

diffusion-llminference-efficiencyparallel-decodingarxivnlp
arXiv 2605.06285

LatentRAG, agentic RAG 추론을 잠재 공간으로 옮겨 추론 지연을 약 90% 절감

Yijia Zheng, Marcel Worring

arXiv 신규 논문 LatentRAG는 agentic RAG의 다단계 추론과 쿼리 생성을 토큰 단위 텍스트에서 연속 잠재 공간으로 옮겨, 명시적 에이전트와 동등한 정확도를 유지하면서 추론 지연을 약 90% 절감한다.

ragagentslatent-reasoninginference-efficiencyretrieval
arXiv 2605.08083

AutoTTS —— LLM 에이전트가 $39.90로 자신의 test-time scaling 전략을 발견

Tong Zheng, Haolin Liu, Chengsong Huang, et al.

AutoTTS는 test-time scaling을 controller-synthesis 문제로 재구성: LLM 에이전트가 branch·continue·probe·prune·stop 시점을 스스로 발견해 수동 튜닝 best-of-N을 대체. 발견 루프 전체가 $39.90 / 160분, 정확도-비용 트레이드오프에서 수동 베이스라인을 능가.

test-time-scalingagentsinference-efficiencyrlreasoning
arXiv 2605.06208

에이전트 컨텍스트 감쇠: 왜 멀티 툴 에이전트가 7회 호출 후 일관성을 잃는가

Jin Park, Aldous Foster, Maya Sundaram, et al.

멀티 스텝 에이전트 일관성의 실증적 경계: 성공률이 Claude 4.7, GPT-5, Gemini 3 Pro에서 7번째 툴 호출에 급락. 툴 트레이스 요약을 통한 완화책이 손실 대부분을 회복.

agentstool-useclaudeopenaigemini
arXiv 2605.05117

프롬프트 캐시 경제: LLM 비용의 73%가 캐시 가능한 프리픽스에 숨어 있다

Hyeonji Lee, Tara Mukherjee, Daniel Roa-Bell

1,400만 프로덕션 LLM 요청 트레이스 분석: 입력 토큰의 73%가 5분 윈도우 내 요청 간 반복. 공급자 간 프롬프트 캐시 비용 절감 정량화 — Anthropic 5분 TTL이 절감의 81% 포착.

prompt-cachinginferencecostanthropicopenai
arXiv 2605.04421

MCP 공급망 정량화: 20만 공개 서버 중 14%가 툴 하이재킹에 취약

Sasha Rubinstein, Mira Wong, Ali Akbarian, et al.

npm/PyPI 레지스트리 200,073개 공개 MCP 서버 실증 스캔: 14.3%가 프롬프트 인젝션 하이재킹에 취약한 툴 설명 노출; 4.8%가 필터링되지 않은 로그에 자격증명 유출. 첫 정량적 MCP 위협 모델.

mcpsecurityagentssupply-chainprompt-injection
arXiv 2604.24763

Tuna-2: pixel 임베딩이 멀티모달 이해에서 vision encoder를 이긴다

Zhiheng Liu, Weiming Ren, Xiaoke Huang

네이티브 통합 멀티모달 모델로, 이미지를 patch 임베딩으로 직접 인코딩합니다. VAE나 별도의 vision encoder가 없습니다. 스케일 업 시 세분화 인지에서 우세를 보입니다.

multimodalvisionarchitecture
arXiv 2604.22074

결과 보상은 추론 과정의 검증 가능성이나 인과적 중요성을 보장하지 않는다

Qinan Yu, Alexa Tartaglini, Peter Hase

CIR(추론의 인과적 중요성)과 SR(추론의 충분성)이라는 두 가지 지표를 제안합니다. RLVR은 정확도를 개선하지만 CIR이나 SR은 반드시 개선하지는 않습니다.

rlvrreasoningcausalitysafety
arXiv 2604.19295

TEMPO: 대형 reasoning 모델을 위한 test-time training 확장

Qingyang Zhang, Xinke Kong, Haitao Wu

Test-time training 프레임워크로, policy는 라벨이 없는 문제 위에서 정제되고 critic은 라벨 데이터로 주기적으로 보정됩니다. OLMO3-7B는 AIME 2024에서 33.0%에서 51.1%로 상승했습니다.

tttreasoningrlvr
arXiv 2604.18788

NPUMoE: Apple Silicon NPU에서 효율적인 MoE LLM 추론

Afsara Benazir, Felix Xiaozhu Lin

런타임이 오프라인 캘리브레이션, 정적 capacity tier, load-aware graph 상주를 통해 NPU 위 MoE의 부적합 문제를 해결합니다. M 시리즈 칩에서 지연 시간을 1.32~5.55배 줄였습니다.

mlxapple-siliconmoeinferenceon-device
arXiv 2604.16529

에이전트 코딩을 위한 test-time compute 확장

Joongwon Kim, Wannan Yang, Kelvin Niu

장기 horizon 코딩 에이전트의 test-time scaling은 "샘플링 문제"가 아니라 "표현 문제"라고 주장합니다. Claude Opus 4.5는 SWE-Bench Verified에서 70.9%에서 77.6%로 상승했습니다.

agentsttccodingfrontier
arXiv 2604.13120

AgentForge: 실행 검증을 핵심으로 하는 멀티 에이전트 SWE 프레임워크

Rajesh Kumar, Waqar Ali, Junaid Ahmed

"실행 검증"을 일등 원칙으로 도입했습니다. 모든 코드 변경은 Docker sandbox에서 통과한 뒤에야 다음으로 전달됩니다. SWE-Bench Lite 40.0%를 달성했습니다.

agentsswemulti-agentsandbox
arXiv 2604.12710

LASA: 시맨틱 보틀넥 레이어에서 언어 독립 안전 정렬

Junxiao Yang, Haoran Liu, Jinzhe Tu

언어 중립적인 "시맨틱 보틀넥" 레이어를 식별했습니다. 정렬을 이 레이어에 앵커링하면 LLaMA-3.1-8B의 공격 성공률이 24.7%에서 2.8%로 낮아집니다.

safetymultilingualalignmentjailbreak
arXiv 2604.10261

The Amazing Agent Race: 도구 호출은 강하지만 웹 내비게이션은 약하다

Zae Myung Kim, Dongseok Lee, Jaehyung Kim

Wikipedia DAG 퍼즐로 벤치마크를 구성했습니다. 1,400 케이스를 세 가지 framework에서 돌린 결과 최고 시스템이 37.2%였고, 내비게이션 오류가 27~52%로 지배적인 반면 도구 호출 오류는 17% 미만이었습니다.

agentsbenchmarknavigationtool-use
커피