arXiv 2605.05117·2026-05-09 — 回閲覧
プロンプト・キャッシュ経済:LLM コストの 73% はキャッシュ可能なプレフィックスに隠れる
Hyeonji Lee, Tara Mukherjee, Daniel Roa-Bell · CMU / Anyscale
1,400 万件のプロダクション LLM リクエストのトレース解析:入力トークンの 73% が 5 分間ウィンドウ内のリクエスト間で繰り返される。プロバイダ横断のプロンプト・キャッシュ・コスト削減を定量化 — Anthropic 5 分 TTL は節約の 81% を捕捉。
プロダクションでのプロンプト・キャッシュ再利用に関する最大規模の実証研究。著者は 3 つの SaaS デプロイメント(チャット・エージェント、コードレビュー、RAG パイプライン)からの 1,400 万 LLM リクエストを解析し、入力トークンを「キャッシュ可能プレフィックス」と「リクエスト固有テール」に分割。
ヘッドライン数値
| 指標 | 値 |
|---|---|
| キャッシュ可能プレフィックスで再発する入力トークンの中央値 % | 73.4% |
| 95 パーセンタイル % | 91.2% |
| すべてのキャッシュ可能プレフィックスがキャッシュにヒットした場合のコスト節約 | 入力コスト 64% 削減 |
| 実際に実現したコスト節約(Anthropic 5 分 TTL) | 38% 削減(理論値の 52%) |
Anthropic が出荷する 5 分 TTL はセッション内再利用の大部分をカバーするが、セッション間再利用の約半分(例:コーヒーブレイク後に戻るユーザー)を逃す。著者は TTL 拡張をモデル化し、30 分 TTL は理論節約の 89% を捕捉すると発見 — ただしプロバイダ側のインフラ・コストは高くなる。
アプリケーション内訳
- チャット・エージェント:79% キャッシュ可能(システム・プロンプト + few-shot 例が安定)
- コードレビュー:84% キャッシュ可能(レビュー・チェックリスト + リポジトリ・コンテキストが支配)
- RAG パイプライン:51% キャッシュ可能(取得チャンクはクエリごとに変動するが、システム・プロンプトは固定)
キャッシュ無効化パターン
最も高価なキャッシュ・ミスは、セッション中のシステム・プロンプト更新。1 バイトの変更がその会話のプレフィックス・キャッシュ全体を無効化する。著者は 3.1% のセッションで少なくとも 1 回のセッション中システム・プロンプト変更があり、これらのセッションが単一バージョン・セッションの 2.4 倍のコストを支払っていることを発見。
実務者のメモ
LLM ワークロードをスケールで実行する誰にとっても 3 つのテイクアウェイ:(1) プロダクションでシステム・プロンプトを反復するのをやめる — バージョン管理してアトミックにデプロイする。(2) プロンプト・キャッシュを有効にせず OpenAI を使っているなら、入力コストの 30〜50% をテーブルに残している;キャッシュ付きエンドポイントに切り替える。(3) Anthropic の 5 分 TTL は実用的なデフォルトだが、セッションがそれを超えるか測定する価値がある — 超える場合、最大の安定ブロックを最初に置くようにプロンプトを構造化して、キャッシュが最も長く生存するようにする。