计费精算

OpenAI Prompt Caching 命中率门槛:什么时候真的把 $/M 打下来

对照官方输入/缓存 Token 价表,拆解 Prompt Caching 折扣如何折算有效单价。给出不同模型下的命中率盈亏平衡点,以及账单里缓存字段该怎么对。

OpenAI Prompt Caching 命中率门槛:什么时候真的把 $/M 打下来

分类: 计费精算

摘要: 对照官方输入/缓存 Token 价表,拆解 Prompt Caching 折扣如何折算有效单价。给出不同模型下的命中率盈亏平衡点,以及账单里缓存字段该怎么对。帮助你用官方数据计算出真正的 $/M 节省,区分 Plus 与 API 计费。

slug: oa-openai-prompt-caching-hit-rate-threshold

模式: plan_new

原因: 读者要对账单时最常卡在「缓存写了但没省多少」。本篇只服务官方 Token 计费与有效单价计算,帮助分清缓存折扣的真实门槛,不涉及账号零售或本地部署。

官方价表里 Input / Cached Input 两列怎么读:折扣比例与模型差异

OpenAI API 官方定价页面将 Prompt Caching 拆成两列:Input(普通输入 Token)和 Cached input(缓存命中 Token)。缓存命中的 Token 按显著折扣单价计费,Input 则按标准价。

以下是当前(2026 年最新)旗舰模型官方价表(每百万 Token):

模型Short context InputCached inputLong context InputCached input
gpt-5.6-sol$5.00$0.50$10.00$1.00
gpt-5.6-terra$2.00$0.20$4.00$0.40
gpt-5.6-luna$0.20$0.02$0.40$0.04
gpt-5.5$5.00$0.50$10.00$1.00
gpt-4o (旧参考)$2.50$1.25--

GPT-5.6 及以后模型:缓存写入额外收费(1.25 倍普通 Input 价),但后续命中仍按 Cached input 价节省。旧模型(GPT-4o 及更早)写入免费,后续命中直接 50% 折扣。长上下文场景下价格通常翻倍,但缓存折扣比例一致。

命中率公式:缓存 Token 占比如何直接压低有效 $/M

账单里 Usage 对象包含:

  • prompt_tokens(总输入 Token)
  • completion_tokens(输出 Token)
  • prompt_tokens_details.cached_tokens(真正命中缓存的 Token 数量)

命中率公式非常简单:

$$ \text{命中率} = \frac{\text{cached\_tokens}}{\text{prompt\_tokens}} \times 100\% $$

有效 $/M 计算公式(以 gpt-5.6-sol 为例):

$$ \text{有效单价} = \frac{\text{prompt\_tokens} - \text{cached\_tokens}}{10^6} \times \$5 + \frac{\text{cached\_tokens}}{10^6} \times \$0.50 + \frac{\text{completion\_tokens}}{10^6} \times \$30 $$

缓存 Token 占比每提高 10%,有效输入单价就能降低约 45%(取决于模型)。这是 Prompt Caching 真正打下 $/M 的核心公式。

盈亏平衡门槛:常见模型下需要多少命中率才真正省钱

盈亏平衡门槛 =(普通 Input 价 - Cached input 价) / 普通 Input 价

模型普通 Input $/MCached input $/M折扣率盈亏平衡门槛
gpt-5.6-sol5.000.5090%约 11%
gpt-5.6-terra2.000.2090%约 11%
gpt-5.6-luna0.200.0290%约 11%
gpt-4o2.501.2550%约 50%

结论:只要命中率超过 11%(新模型)或 50%(老模型),缓存就能让整体 $/M 下降。即使只有 20% 命中率,新模型也能节省近 20% 整体费用。多数真实场景下系统提示 + 重复调用很容易达到 70-90% 命中率。

账单字段对照:Usage 里的 cached_tokens 与对账步骤

  1. 登录 platform.openai.com 查看账单。
  2. 找到当月记录,点击查看详情,复制 Usage 对象。
  3. 对比:

- total_tokens = prompt_tokens + completion_tokens - prompt_tokens_details.cached_tokens(命中缓存 Token) - prompt_tokens - cached_tokens = 未命中 Token

  1. 手动复算有效 $/M,核对是否和官方定价一致。

长上下文与重复系统提示:缓存最容易生效的场景

缓存最容易命中场景:

  • 长上下文:单次调用含 10k+ Token 的系统提示 + 历史对话。
  • 重复调用:同一业务流程、相同系统指令、模板化输出(如「请用中文回复」)。
  • 多轮对话:用户问题变化,但系统提示和工具定义不变。

典型命中率区间:

  • 简单客服系统:80-95%
  • 代码生成多轮迭代:60-85%
  • 纯一次性调用:0-30%

把稳定内容放在 prompt 开头 + 使用 prompt_cache_key(新模型强制),命中率轻松拉高。

与实时调用、Batch API 的组合决策:何时叠加折扣

推荐组合

  • 实时调用(Chat Completions API):高命中率场景叠加 Prompt Caching + 实时流式输出。
  • Batch API:适合批量大文件,开启缓存后每条记录 $/M 可再降 30-50%。注意 Batch 需先写缓存,后续批次可命中。
  • 长期策略:用 Prompt Caching 优化单次调用,Batch 批量处理任务。

决策公式:如果单次命中率 >15%,优先 Prompt Caching;如果日均调用量 >1000 且命中率 >50%,优先 Batch。

对账检查清单:避免把未命中的缓存当成已折扣

  • 检查 cached_tokens 是否 >0(命中)。
  • 确认 prompt_cache_key 是否一致(新模型)。
  • 排除 GPT-5.6 及以后模型的缓存写入额外计费。
  • 验证命中率是否真实:cached_tokens / prompt_tokens 是否和预期一致。
  • 跨模型调用时不要混用旧模型缓存字段。

风险与边界

风险与边界 Prompt Caching 仅限 OpenAI 官方 API,不适用于本地部署、第三方 SDK 或非 OpenAI 渠道。缓存命中率受模型版本、prompt 结构、TTL(缓存保留期)和 prompt_cache_key 影响,极端场景下可能为 0。数据仅供参考,非法律意见。

延伸阅读

English summary

Prompt Caching is OpenAI's feature that reuses exact prompt prefixes for lower latency and cost. It works automatically on models from GPT-4o onward, with a minimum 1024-token prefix required. Cache hits are reported in the Usage object as cached_tokens and billed at a discounted rate compared to regular Input tokens (typically 50% or more off).

The official pricing page shows separate columns for Input and Cached input. For example, on GPT-5.6 models the cached rate is often 90% cheaper. Effective cost per million tokens is calculated by subtracting cached tokens from total prompt tokens and applying the regular rate to the remainder.

Hit rate threshold varies by model: around 11% for GPT-5.6 series and 50% for older models like GPT-4o. Once hit rate exceeds this point, overall $/M savings are positive. Real-world scenarios like long-context system prompts and repeated calls easily reach 60-90% hit rates when stable content is placed at the beginning of prompts.

On the bill, always cross-check prompt_tokens, completion_tokens, and prompt_tokens_details.cached_tokens. Use the provided formula to compute true effective price and reconcile with official rates.

Combine Prompt Caching with Batch API or streaming for maximum savings on high-volume workloads. Always verify prompt_cache_key on newer models and watch for explicit breakpoint usage on GPT-5.6+.

This guide helps API users on openaicn.cn calculate real savings, choose between Plus and API, and avoid overestimating discounts. Data is based on the latest official OpenAI API pricing as of August 2026.

适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。