计费精算

什么时候缓存价真能省钱

长系统提示复用、多轮同前缀;短请求几乎无感。

正文為 SEO 深度以中文為主;上方要點已本地化。可用語言切換與深鏈進行全球導航。

## 什么时候缓存价真能省钱

这是什么? OpenAI Prompt Caching 是官方自动为输入提示词的公共前缀(系统提示、多轮对话固定部分)提供高达 90% 折扣的内置机制。只要你的提示词长度超过 1,024 tokens 并共享前缀,缓存读就会以 $0.02–$0.50 /M tokens(视模型)的极低单价计费,而非标准输入价。 谁适用? ChatGPT Plus / Pro / Team 用户、Agent 开发者、Claude Code 或 Cursor 用户在生产级多轮对话、工具链或长上下文场景中。 怎么决策? 统计调用量、提示词复用率与实际 $ /M 支出即可。如果每天重复运行 1,000 次以上且前缀稳定,缓存就能显著降低对账单支出。

OpenAI API 官方计费表显示,缓存输入 tokens 的单价远低于普通输入(例如 GPT-5.6 系列标准输入 $5.00 /M,缓存输入 $0.50 /M;GPT-5.6 Luna 更低至 $0.20 /M 标准、$0.02 /M 缓存)。Prompt 缓存价格 真正发挥作用的场景,正是多轮同前缀或长系统提示复用时——短请求几乎无感,单次调用可能看不到任何折扣。

OpenAICN 作为 OpenAI 官方 API 计费对照站,这里详细拆解缓存价真能省钱的条件、实际效果与对账单优化,帮助开发者分清 ChatGPT Plus 与纯 API 的成本差异,避免盲目按标准价格对账。

Prompt 缓存定价机制详解

OpenAI Prompt Caching 完全自动,无需代码修改或额外配置。它在支持的模型(gpt-4o 及最新系列,包括 GPT-5.6 家族)上自动缓存最长的前缀(起点 1,024 tokens,每 128 tokens 递增)。缓存读(cached_tokens)按官方价格计费,输出 tokens 与标准一致。

缓存写(cache_write_tokens)在 GPT-5.6 之前无额外费用,之后按 1.25 倍标准输入价计费。API 返回中 usage 字段会明确显示 cached_tokensprompt_tokens,便于实时监控。

#### 典型模型缓存输入单价(2026 年 8 月官方参考) 以下表格基于 OpenAI 官方定价,对比标准输入与缓存输入:

模型标准输入 $/M缓存输入 $/M折扣率输出 $/M
GPT-5.6 Sol$5.00$0.5090%$30.00
GPT-5.6 Terra$2.00$0.2090%$12.00
GPT-5.6 Luna$0.20$0.0290%$1.20
GPT-5.5$5.00$0.5090%$30.00
GPT-5.4$2.50$0.2590%$15.00
GPT-4.1$1.00$0.2575%$4.00
GPT-4o$1.25$0.62550%$5.00

(数据来源于 OpenAI 官方定价页与平台文档,缓存读在长上下文下可能略有调整。)

什么时候缓存价真正省钱?核心条件与案例

1. 多轮对话或 Agent 场景(最典型) 系统提示 + 用户历史消息固定部分(如工具定义、知识库索引)可重复。

  • 示例:一个 4,000 tokens 的系统提示 + 2,000 tokens 用户输入,每轮调用 500 次。
  • 未缓存:输入总成本 = (6,000 × 500) / 1,000,000 × $5 = $15,000 / 月。
  • 缓存后(90% 前缀复用):实际计费约 $1,500 / 月(节省 90% 输入部分)。
  • OpenAI API 计费 中,缓存读直接体现为 $ /M tokens 的巨大优势。

2. 长系统提示复用 ChatGPT Plus 用户或开发者在 Cursor / Claude Code 中构建提示链时,前缀稳定,缓存命中率可达 80–95%。官方文档明确:缓存可将输入成本降低最高 90%,延迟降低最高 80%。

3. 高频连续调用 即使 5–10 分钟内多次请求,缓存也保持活跃。结合 prompt_cache_key 参数可进一步提升命中率。

4. Batch API 与缓存叠加 异步任务中,缓存读仍按标准缓存价计费(非额外优惠),但整体可与 Batch 50% 折扣搭配,实现更低 $ /M 支出。

#### 真实对账单节省估算示例 假设每日 1,000 次调用,平均输入 3,000 tokens(含 2,700 tokens 固定前缀),输出 500 tokens(不缓存):

  • 标准输入价(以 GPT-5.6 Luna 为例,$0.20 /M):单次输入成本 $0.60,缓存部分 $0.06。
  • 实际:$0.06 + 缓存写(若需) + 输出 $0.60。
  • 月节省:若命中率 70%,输入部分可省约 $420 / 月(完全按官方缓存单价计算)。

缓存价真能省钱 的核心公式: 节省 = 提示词 tokens × 调用次数 × 30 × 命中率 × (标准输入价 - 缓存输入价) 当命中率 > 50% 且调用量 > 数千次时,效果显著。

实用优化建议与 API 监控

  • 监控工具:在代码中打印 usage.prompt_tokens_details.cached_tokens,或在 OpenAI Dashboard 查看计费报告。
  • 提示词设计:保持系统提示固定,使用 prompt_cache_key(GPT-5.6+ 专有)锁定缓存。
  • 模型选择:优先 GPT-5.6 Luna / Terra 等支持 90% 缓存的模型;旧模型如 GPT-4o 仅 50% 折扣,效果打折。
  • ChatGPT Plus 与 API 分账:Plus 用户可同时享受缓存与订阅额度,API 用户则需严格按官方 $ /M 跟踪。

注意:缓存对输出、图像或音频 tokens 无影响;缓存窗口有限(GPT-5.6 系列至少 30 分钟,早期模型更短);不同服务器或路由可能导致命中率波动。

风险与边界

缓存并非万能。

  • 提示词前缀微调(加时间戳、版本号)会立即失效。
  • 低频调用(每日 < 100 次)或短请求(< 1,024 tokens)几乎无感。
  • 极端长上下文或不稳定前缀可能降低命中率,甚至略高开销。
  • 缓存写在 GPT-5.6 后需额外监控 1.25× 费用。

此内容仅为参考,不构成法律意见。 OpenAI API 定价以官网 https://openai.com/api/pricing 为准,实际对账单以官方数据为准。OpenAICN 仅提供公开信息参考,不保证实时准确性。

延伸阅读

English summary

OpenAI Prompt Caching automatically saves money on repeated prompt prefixes by charging cached input tokens at 90% lower rates (e.g., $0.50/M vs $5.00/M on GPT-5.6 Sol). It applies to multi-turn conversations, long system prompts, and Agent workflows with stable prefixes.

Savings require: prompt length >1,024 tokens, high reuse frequency (>50% hit rate), and continuous calls. Output tokens are not cached, and short requests yield zero benefit.

Real savings: for 1,000 daily calls with 3,000-token input and 70% hit rate, you can cut input costs by hundreds of dollars monthly—directly visible in usage.cach ed_tokens.

Monitor via API responses or Dashboard; use prompt_cache_key for better locality. Works alongside Batch API and ChatGPT Plus subscriptions.

Not universal: minor prefix changes or low volume kill the discount. Always check official pricing at openai.com/api/pricing for your model. This guide helps reconcile your OpenAI API bill accurately.

适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。