arXiv 2605.05117·2026-05-09 — 次瀏覽
Prompt 快取經濟:73% 的 LLM 成本隱藏在可快取前綴中
Hyeonji Lee, Tara Mukherjee, Daniel Roa-Bell · CMU / Anyscale
1,400 萬筆生產 LLM 請求的軌跡分析:73% 的輸入 token 在 5 分鐘窗口內跨請求重複。量化跨供應商的 prompt 快取成本節省 — Anthropic 5 分鐘 TTL 捕獲 81% 的節省。
關於生產 prompt 快取重用的最大規模實證研究。作者分析了來自三個 SaaS 部署(聊天代理、程式碼審查、RAG 流水線)的 1,400 萬筆 LLM 請求,並將輸入 token 分為「可快取前綴」與「請求獨特尾部」。
標題數字
| 指標 | 數值 |
|---|---|
| 在可快取前綴中復發的輸入 token 中位數 % | 73.4% |
| 95 百分位 % | 91.2% |
| 若所有可快取前綴命中快取的成本節省 | 輸入成本減少 64% |
| 實際實現的成本節省(Anthropic 5 分鐘 TTL) | 減少 38%(理論值的 52%) |
Anthropic 出貨的 5 分鐘 TTL 涵蓋大部分會話內重用,但錯過約一半跨會話重用(例如,喝咖啡後回來的使用者)。作者建模 TTL 擴展,發現 30 分鐘 TTL 將捕獲 89% 的理論節省 — 但供應商側基礎設施成本更高。
應用分解
- 聊天代理:79% 可快取(系統 prompt + 少樣本範例穩定)
- 程式碼審查:84% 可快取(審查清單 + 倉庫上下文主導)
- RAG 流水線:51% 可快取(檢索區塊每次查詢變化,但系統 prompt 固定)
快取失效模式
最昂貴的快取錯誤是會話中間更新系統 prompt。單一位元組變化會使該對話的整個前綴快取失效。作者發現 3.1% 的會話有至少一次會話中系統 prompt 變更,這些會話付出單版本會話 2.4 倍的成本。
實踐者注記
對於任何大規模運行 LLM 工作負載的人,三個要點:(1) 停止在生產中迭代系統 prompt — 對其版本化並原子部署。(2) 如果你在 OpenAI 上沒有啟用 prompt 快取,你正讓 30-50% 的輸入成本流失;切換到快取端點。(3) Anthropic 的 5 分鐘 TTL 是實用的預設,但值得衡量你的會話是否超過它 — 如果是,將你的 prompt 結構化為把最大穩定區塊放在前面,這樣快取存活最久。