OpenAI Prompt Caching 2026 官方计费指南:输入缓存 $/M 与命中率门槛
详解 OpenAI GPT-5.6 系列与 o 系列官方 Prompt Caching 价格、缓存写/读倍率、自动触发机制及命中率门槛,帮助开发者对账单时精确计算 Cache 字段节省,免受 Plus 与 API 计费混淆。
본문은 SEO 깊이를 위해 주로 중국어입니다. 위는 현지화 요점입니다. 언어 전환·딥링크로 글로벌 탐색하세요.

OpenAI Prompt Caching 2026 官方计费指南:输入缓存 $/M 与命中率门槛
OpenAI Prompt Caching(提示词缓存)是官方 API 自动为开发者降低成本和延迟的核心功能。它适用于 GPT-5.6 系列与 o 系列等支持模型,当提示词包含重复的前缀(如系统提示词、工具定义或稳定上下文)时,OpenAI 会自动命中缓存,实现高达 90% 的输入 token 节省。适用于任何使用 OpenAI API 的开发者,尤其是构建多轮对话、Agent 工作流或批量任务的应用。开发者通过查看账单中的 cached_tokens 字段即可精确对账,避免将 Plus 订阅或非缓存输入计费混淆。
OpenAI 官方定价页最新 Token 价格表(2026 年 8 月)
官方定价页面(https://platform.openai.com/docs/pricing)已明确区分普通输入与缓存输入。以下为 GPT-5.6 系列主力模型的标准价格(Short context 场景,上下文长度 <270K):
| 模型 | 普通输入 ($/M) | 缓存输入 ($/M) | 输出 ($/M) |
|---|---|---|---|
| gpt-5.6-sol | 5.00 | 0.50 | 30.00 |
| gpt-5.6-terra | 2.00 | 0.20 | 12.00 |
| gpt-5.6-luna | 0.20 | 0.02 | 1.20 |
对账单速查逻辑:普通输入按上述价格计费,缓存命中部分仅按缓存输入价格结算。长上下文场景价格通常翻倍(例如 sol 长上下文缓存输入为 1.00 $/M)。Batch API 提供约 50% 折扣,可与缓存叠加使用,具体见下方决策表。
Prompt Caching 如何自动工作:前缀缓存触发与 30 分钟/24 小时保留
OpenAI Prompt Caching 完全自动,无需任何代码修改即可触发。机制基于以下步骤:
- 请求路由到预热过相同前缀的服务器。
- 检测精确前缀匹配(默认长度 ≥1024 tokens)。
- 命中时跳过重算,账单字段显示
cached_tokens(读入缓存部分),无需额外写费(GPT-5.6 之前模型)或仅需 1.25× 普通输入价格(GPT-5.6 及以后模型)。
保留机制:
- GPT-5.6 系列及以后:默认 30 分钟(可通过参数延长,最多更长,实际可能超过)。
- 早期模型:支持 5-10 分钟或 24 小时扩展保留。
- 命中率门槛:连续 5-10 次重复调用同一前缀即可有效命中并节省;高频 Agent 场景下 >60% 命中率即可实现显著节省(低于此则接近普通输入成本)。
开发者可通过 prompt_cache_key 参数优化多键共享,进一步提升命中率。
GPT-5.6 系列 Cache 输入官方价格:$/M 倍率(0.02–0.50 范围)与写价 1.25 倍
GPT-5.6 系列缓存输入价格为普通输入的 10%(0.02–0.50 $/M 范围)。Cache 写(仅 GPT-5.6 以后)按 1.25 倍普通输入价格计费,例如:
- gpt-5.6-luna:普通输入 0.20 $/M,缓存读 0.02 $/M,写 0.25 $/M。
- gpt-5.6-terra:写 2.50 $/M。
节省计算公式(任一模型通用): `` 节省率 = (命中率 × 90%) - (非命中率 × 10%) - (写费影响) `` 例如:100% 命中(无写) = 90% 节省;80% 命中且需写 10% 前缀 = 净节省约 70%。
o 系列与早期模型缓存节省计算公式:命中率 >60% 即省钱
早期模型(gpt-4o 及之前)缓存读仍享 50-75% 折扣,无写费。o 系列(o1、o3 等)虽官方定价页不显示缓存输入字段,但通过 implicit caching 自动启用,实际节省率与 GPT-5.6 一致(约 90% 输入折扣)。
通用节省公式: `` 净节省 % = (1 - 命中率) × 0.9 - (写费影响 × 写率) ` 命中率 >60% 时,即使带写费,净节省仍为正(开发者账单中 cached_tokens + cache_write_tokens` 可直接复核)。
真实场景命中率门槛:系统提示词/工具定义重复时节省 %
典型 Agent 或工具调用场景中,系统提示词与工具定义重复度极高,命中率可达 80-95%:
- 重复系统指令(固定 2000+ tokens)节省 85-90% 输入成本。
- 工具定义重复(函数描述/参数模板)节省 75-90%。
- 聊天历史前缀重复(多轮对话)节省 70-85%。
建议开发者将稳定内容放在提示词开头,并使用 prompt_cache_breakpoint 标记断点,可将命中率从 60% 提升至 90%以上,从而在账单中精确反映“Cache 字段”节省(例如 10k tokens 缓存读 = 节省 9k tokens)。
Batch API 与 Cache 叠加折扣表:延迟换折扣完整决策
Batch API 提供 50% 基础折扣,可与 Prompt Caching 叠加使用(缓存读再享 90% 额外折扣)。延迟换折扣决策表:
| 场景 | 普通输入 ($/M) | 缓存读 ($/M) | Batch 叠加 ($/M) | 推荐场景 |
|---|---|---|---|---|
| gpt-5.6-sol(短上下文) | 5.00 | 0.50 | 1.25(批 + 缓) | 低延迟任务 |
| gpt-5.6-terra | 2.00 | 0.20 | 0.50 | 高频 Agent |
| gpt-5.6-luna | 0.20 | 0.02 | 0.05 | 大规模批量 |
| 早期模型(无写费) | 标准 | 0.10× | 0.50 | 聊天历史重复 |
决策原则:命中率 >70% 时优先 Batch + Cache;延迟敏感场景保留标准模式。
对账单字段速查:Input(缓存前) vs Cached Input vs Output
账单字段直接反映缓存节省(从 OpenAI API 响应 usage 中获取):
- Input(缓存前):完整提示词 token 数,原始计费基础。
- Cached Input:命中缓存的 token 数,按缓存输入价格计费。
- Output:生成 token 数,按输出价格计费。
- Cache Write(可选,GPT-5.6+):新写前缀 token,按 1.25× 输入价格计费。
- Usage.total:最终结算金额 = (普通输入 × 非缓存) + (缓存输入 × Cached) + 输出。
示例:前缀 10k tokens 写一次 + 20 次读 9k tokens 缓存 = 节省约 9k tokens(90%),开发者只需对比账单“Cache 字段”与定价页即可。
风险与边界
Prompt Caching 为官方自动机制,无需手动优化,但建议保持提示词前缀一致以维持高命中率。非法律意见声明:本文基于 OpenAI 官方定价页与文档(https://platform.openai.com/docs/pricing 及 https://platform.openai.com/docs/guides/prompt-caching),纯属开发者对账参考,非投资或法律意见。实际计费以 OpenAI 官方账户为准,价格可能随模型更新调整。请查阅最新官方文档验证。
延伸阅读
English summary
OpenAI Prompt Caching 2026 official billing guide explains input cache $/M rates and hit rate thresholds for GPT-5.6 and o-series models. Developers can automatically save up to 90% on repeated prompt prefixes like system instructions or tool definitions. Cache works for prompts ≥1024 tokens with 30-minute minimum retention (longer in practice). For GPT-5.6+, cache writes cost 1.25× base input rate while reads get 90% off; early models have no extra write fee. Savings formulas and real-world examples (e.g., 80%+ hit rate on stable prefixes) help reconcile billing fields like cached_tokens vs cache_write_tokens. Batch API overlays 50% discount with caching for cost optimization. Always verify latest rates on openai.com/api/pricing as they update monthly. This guide serves as a developer resource for precise cost calculation without mixing Plus subscriptions or API pricing.
适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。