Skip to content
AI-Daily-Builder

arXiv 2605.05117·2026-05-09 次瀏覽

Prompt 快取經濟:73% 的 LLM 成本隱藏在可快取前綴中

Hyeonji Lee, Tara Mukherjee, Daniel Roa-Bell · CMU / Anyscale

1,400 萬筆生產 LLM 請求的軌跡分析:73% 的輸入 token 在 5 分鐘窗口內跨請求重複。量化跨供應商的 prompt 快取成本節省 — Anthropic 5 分鐘 TTL 捕獲 81% 的節省。

arxiv.org/abs/2605.05117 ↗


關於生產 prompt 快取重用的最大規模實證研究。作者分析了來自三個 SaaS 部署(聊天代理、程式碼審查、RAG 流水線)的 1,400 萬筆 LLM 請求,並將輸入 token 分為「可快取前綴」與「請求獨特尾部」。

標題數字

指標數值
在可快取前綴中復發的輸入 token 中位數 %73.4%
95 百分位 %91.2%
若所有可快取前綴命中快取的成本節省輸入成本減少 64%
實際實現的成本節省(Anthropic 5 分鐘 TTL)減少 38%(理論值的 52%)

Anthropic 出貨的 5 分鐘 TTL 涵蓋大部分會話內重用,但錯過約一半跨會話重用(例如,喝咖啡後回來的使用者)。作者建模 TTL 擴展,發現 30 分鐘 TTL 將捕獲 89% 的理論節省 — 但供應商側基礎設施成本更高。

應用分解

快取失效模式

最昂貴的快取錯誤是會話中間更新系統 prompt。單一位元組變化會使該對話的整個前綴快取失效。作者發現 3.1% 的會話有至少一次會話中系統 prompt 變更,這些會話付出單版本會話 2.4 倍的成本。

實踐者注記

對於任何大規模運行 LLM 工作負載的人,三個要點:(1) 停止在生產中迭代系統 prompt — 對其版本化並原子部署。(2) 如果你在 OpenAI 上沒有啟用 prompt 快取,你正讓 30-50% 的輸入成本流失;切換到快取端點。(3) Anthropic 的 5 分鐘 TTL 是實用的預設,但值得衡量你的會話是否超過它 — 如果是,將你的 prompt 結構化為把最大穩定區塊放在前面,這樣快取存活最久。

請喝咖啡