官方API

OpenAI Prompt Caching 2026 官方计费指南:输入缓存 $/M 与命中率门槛

详解 OpenAI GPT-5.6 系列与 o 系列官方 Prompt Caching 价格、缓存写/读倍率、自动触发机制及命中率门槛,帮助开发者对账单时精确计算 Cache 字段节省,免受 Plus 与 API 计费混淆。

본문은 SEO 깊이를 위해 주로 중국어입니다. 위는 현지화 요점입니다. 언어 전환·딥링크로 글로벌 탐색하세요.

OpenAI Prompt Caching 2026 官方计费指南:输入缓存 $/M 与命中率门槛

OpenAI Prompt Caching(提示词缓存)是官方 API 自动为开发者降低成本和延迟的核心功能。它适用于 GPT-5.6 系列与 o 系列等支持模型,当提示词包含重复的前缀(如系统提示词、工具定义或稳定上下文)时,OpenAI 会自动命中缓存,实现高达 90% 的输入 token 节省。适用于任何使用 OpenAI API 的开发者,尤其是构建多轮对话、Agent 工作流或批量任务的应用。开发者通过查看账单中的 cached_tokens 字段即可精确对账,避免将 Plus 订阅或非缓存输入计费混淆。

OpenAI 官方定价页最新 Token 价格表(2026 年 8 月)

官方定价页面(https://platform.openai.com/docs/pricing)已明确区分普通输入与缓存输入。以下为 GPT-5.6 系列主力模型的标准价格(Short context 场景,上下文长度 <270K):

模型普通输入 ($/M)缓存输入 ($/M)输出 ($/M)
gpt-5.6-sol5.000.5030.00
gpt-5.6-terra2.000.2012.00
gpt-5.6-luna0.200.021.20

对账单速查逻辑:普通输入按上述价格计费,缓存命中部分仅按缓存输入价格结算。长上下文场景价格通常翻倍(例如 sol 长上下文缓存输入为 1.00 $/M)。Batch API 提供约 50% 折扣,可与缓存叠加使用,具体见下方决策表。

Prompt Caching 如何自动工作:前缀缓存触发与 30 分钟/24 小时保留

OpenAI Prompt Caching 完全自动,无需任何代码修改即可触发。机制基于以下步骤:

  1. 请求路由到预热过相同前缀的服务器。
  2. 检测精确前缀匹配(默认长度 ≥1024 tokens)。
  3. 命中时跳过重算,账单字段显示 cached_tokens(读入缓存部分),无需额外写费(GPT-5.6 之前模型)或仅需 1.25× 普通输入价格(GPT-5.6 及以后模型)。

保留机制

  • GPT-5.6 系列及以后:默认 30 分钟(可通过参数延长,最多更长,实际可能超过)。
  • 早期模型:支持 5-10 分钟或 24 小时扩展保留。
  • 命中率门槛:连续 5-10 次重复调用同一前缀即可有效命中并节省;高频 Agent 场景下 >60% 命中率即可实现显著节省(低于此则接近普通输入成本)。

开发者可通过 prompt_cache_key 参数优化多键共享,进一步提升命中率。

GPT-5.6 系列 Cache 输入官方价格:$/M 倍率(0.02–0.50 范围)与写价 1.25 倍

GPT-5.6 系列缓存输入价格为普通输入的 10%(0.02–0.50 $/M 范围)。Cache 写(仅 GPT-5.6 以后)按 1.25 倍普通输入价格计费,例如:

  • gpt-5.6-luna:普通输入 0.20 $/M,缓存读 0.02 $/M,写 0.25 $/M。
  • gpt-5.6-terra:写 2.50 $/M。

节省计算公式(任一模型通用): `` 节省率 = (命中率 × 90%) - (非命中率 × 10%) - (写费影响) `` 例如:100% 命中(无写) = 90% 节省;80% 命中且需写 10% 前缀 = 净节省约 70%。

o 系列与早期模型缓存节省计算公式:命中率 >60% 即省钱

早期模型(gpt-4o 及之前)缓存读仍享 50-75% 折扣,无写费。o 系列(o1、o3 等)虽官方定价页不显示缓存输入字段,但通过 implicit caching 自动启用,实际节省率与 GPT-5.6 一致(约 90% 输入折扣)。

通用节省公式: `` 净节省 % = (1 - 命中率) × 0.9 - (写费影响 × 写率) ` 命中率 >60% 时,即使带写费,净节省仍为正(开发者账单中 cached_tokens + cache_write_tokens` 可直接复核)。

真实场景命中率门槛:系统提示词/工具定义重复时节省 %

典型 Agent 或工具调用场景中,系统提示词与工具定义重复度极高,命中率可达 80-95%:

  • 重复系统指令(固定 2000+ tokens)节省 85-90% 输入成本。
  • 工具定义重复(函数描述/参数模板)节省 75-90%
  • 聊天历史前缀重复(多轮对话)节省 70-85%

建议开发者将稳定内容放在提示词开头,并使用 prompt_cache_breakpoint 标记断点,可将命中率从 60% 提升至 90%以上,从而在账单中精确反映“Cache 字段”节省(例如 10k tokens 缓存读 = 节省 9k tokens)。

Batch API 与 Cache 叠加折扣表:延迟换折扣完整决策

Batch API 提供 50% 基础折扣,可与 Prompt Caching 叠加使用(缓存读再享 90% 额外折扣)。延迟换折扣决策表:

场景普通输入 ($/M)缓存读 ($/M)Batch 叠加 ($/M)推荐场景
gpt-5.6-sol(短上下文)5.000.501.25(批 + 缓)低延迟任务
gpt-5.6-terra2.000.200.50高频 Agent
gpt-5.6-luna0.200.020.05大规模批量
早期模型(无写费)标准0.10×0.50聊天历史重复

决策原则:命中率 >70% 时优先 Batch + Cache;延迟敏感场景保留标准模式。

对账单字段速查:Input(缓存前) vs Cached Input vs Output

账单字段直接反映缓存节省(从 OpenAI API 响应 usage 中获取):

  • Input(缓存前):完整提示词 token 数,原始计费基础。
  • Cached Input:命中缓存的 token 数,按缓存输入价格计费。
  • Output:生成 token 数,按输出价格计费。
  • Cache Write(可选,GPT-5.6+):新写前缀 token,按 1.25× 输入价格计费。
  • Usage.total:最终结算金额 = (普通输入 × 非缓存) + (缓存输入 × Cached) + 输出。

示例:前缀 10k tokens 写一次 + 20 次读 9k tokens 缓存 = 节省约 9k tokens(90%),开发者只需对比账单“Cache 字段”与定价页即可。

风险与边界

Prompt Caching 为官方自动机制,无需手动优化,但建议保持提示词前缀一致以维持高命中率。非法律意见声明:本文基于 OpenAI 官方定价页与文档(https://platform.openai.com/docs/pricing 及 https://platform.openai.com/docs/guides/prompt-caching),纯属开发者对账参考,非投资或法律意见。实际计费以 OpenAI 官方账户为准,价格可能随模型更新调整。请查阅最新官方文档验证。

延伸阅读

English summary

OpenAI Prompt Caching 2026 official billing guide explains input cache $/M rates and hit rate thresholds for GPT-5.6 and o-series models. Developers can automatically save up to 90% on repeated prompt prefixes like system instructions or tool definitions. Cache works for prompts ≥1024 tokens with 30-minute minimum retention (longer in practice). For GPT-5.6+, cache writes cost 1.25× base input rate while reads get 90% off; early models have no extra write fee. Savings formulas and real-world examples (e.g., 80%+ hit rate on stable prefixes) help reconcile billing fields like cached_tokens vs cache_write_tokens. Batch API overlays 50% discount with caching for cost optimization. Always verify latest rates on openai.com/api/pricing as they update monthly. This guide serves as a developer resource for precise cost calculation without mixing Plus subscriptions or API pricing.

适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。