Skip to content
AI-Daily-Builder

arXiv 2605.05117·2026-05-09 회 조회

프롬프트 캐시 경제: LLM 비용의 73%가 캐시 가능한 프리픽스에 숨어 있다

Hyeonji Lee, Tara Mukherjee, Daniel Roa-Bell · CMU / Anyscale

1,400만 프로덕션 LLM 요청 트레이스 분석: 입력 토큰의 73%가 5분 윈도우 내 요청 간 반복. 공급자 간 프롬프트 캐시 비용 절감 정량화 — Anthropic 5분 TTL이 절감의 81% 포착.

arxiv.org/abs/2605.05117 ↗


프로덕션 프롬프트 캐시 재사용에 관한 최대 규모 실증 연구. 저자들은 세 SaaS 배포(채팅 에이전트, 코드 리뷰, RAG 파이프라인)에서 1,400만 LLM 요청을 분석하고 입력 토큰을 “캐시 가능 프리픽스”와 “요청 고유 테일”로 분할.

헤드라인 숫자

지표
캐시 가능 프리픽스에서 재발하는 입력 토큰 중앙값 %73.4%
95 백분위 %91.2%
모든 캐시 가능 프리픽스가 캐시 히트할 경우 비용 절감입력 비용 64% 감소
실제 실현된 비용 절감(Anthropic 5분 TTL)38% 감소(이론값의 52%)

Anthropic이 출하하는 5분 TTL은 세션 내 재사용 대부분을 커버하지만, 세션 간 재사용의 약 절반(예: 커피 브레이크 후 돌아오는 사용자)을 놓친다. 저자들은 TTL 확장을 모델링하고 30분 TTL이 이론적 절감의 89%를 포착하는 것을 발견 — 그러나 공급자 측 인프라 비용은 더 높다.

애플리케이션 분해

캐시 무효화 패턴

가장 비싼 캐시 실수는 세션 중간에 시스템 프롬프트를 업데이트하는 것. 단일 바이트 변경이 그 대화의 전체 프리픽스 캐시를 무효화한다. 저자들은 3.1% 세션에 최소 한 번 세션 중 시스템 프롬프트 변경이 있었고, 이들 세션은 단일 버전 세션의 2.4배 비용을 지불한다고 발견.

실무자 노트

LLM 워크로드를 스케일로 운영하는 누구에게나 세 가지 시사점: (1) 프로덕션에서 시스템 프롬프트를 반복하는 것을 멈춰라 — 버전 관리하고 원자적으로 배포하라. (2) 프롬프트 캐싱을 활성화하지 않은 OpenAI에 있다면, 입력 비용의 30-50%를 테이블에 두고 있는 것; 캐시된 엔드포인트로 전환하라. (3) Anthropic의 5분 TTL은 실용적 기본값이지만, 세션이 그것을 초과하는지 측정할 가치가 있다 — 초과한다면, 가장 큰 안정 블록을 먼저 놓도록 프롬프트를 구조화해 캐시가 가장 오래 생존하도록 하라.

커피