2026 OpenAI API 官方 Token $/M 价格表:缓存输入、Cache Write 与有效单价精算
最新 GPT-5.6 / GPT-5.5 / GPT-5.4 系列官方输入、缓存输入、Cache Write、输出价格对比,包含长上下文倍率、Batch 折扣及真实有效单价计算示例,帮助对账单用户快速核对 API 消费。
Full article body is primarily in Chinese for SEO depth; key points above are localized. Use the language switcher and deep links for global navigation.

2026 OpenAI API 官方 Token $/M 价格表:缓存输入、Cache Write 与有效单价精算
这是 OpenAI 2026 年最新 GPT-5.6 / GPT-5.5 / GPT-5.4 系列官方定价指南,聚焦 Input、Cached Input、Cache Write 和 Output 的 $/M(每百万 Token)价格,以及长上下文倍率、Batch 50% 折扣和真实有效单价计算。适用于对账单的用户、开发者和企业财务团队,帮助快速核对 Usage API 消费、评估缓存节省幅度,并选择最优模型与策略。[[1]](https://developers.openai.com/api/docs/pricing)[[2]](https://developers.openai.com/api/docs/guides/prompt-caching)
通过本文,你可以直接对比不同模型的官方价格,理解缓存如何将输入成本降低至原价的 10%,并用具体公式计算月账单真实成本。所有数据来源于 OpenAI 官方定价页,事实可核验。
2026 年 OpenAI API 最新定价概览与关键变化
2026 年 OpenAI API 定价以 GPT-5.6 系列为核心,引入 Cache Write 单独计费(GPT-5.6 及以后模型按 1.25× 标准 Input 价格收取),同时 Cached Input 普遍维持约 90% 折扣。长上下文(通常 >270K tokens)会触发全会话倍率:Input ×2、Output ×1.5。Batch API(异步处理,24 小时内返回)提供统一 50% 折扣,适合非实时批量任务。[[1]](https://developers.openai.com/api/docs/pricing)
关键变化:
- GPT-5.6-sol/terra/luna 系列新增 Cache Write 列,写入缓存需额外付费,但后续读取大幅节省。
- 旧版 GPT-5.5 / 5.4 系列 Cache Write 标记为 “-”(无额外费用或沿用旧机制)。
- Regional processing(数据驻留)对 2026 年 3 月 5 日后模型加收 10% uplift。
- Fast mode(原 Priority)提供更高优先级但价格更高(未在基础表列出)。
- Prompt Caching 自动针对前缀 ≥1024 tokens 生效,GPT-5.6+ 推荐使用
prompt_cache_key和显式 breakpoint 提升命中率。[[2]](https://developers.openai.com/api/docs/guides/prompt-caching)
GPT-5.6 / 5.5 / 5.4 全系列官方 $/M Token 价格表
以下表格列出短上下文(<270K)和长上下文价格(单位:$/M tokens)。移动端可横向滚动查看。
| 模型 | Input (短) | Cached Input (短) | Cache Write (短) | Output (短) | Input (长) | Cached Input (长) | Cache Write (长) | Output (长) |
|---|---|---|---|---|---|---|---|---|
| gpt-5.6-sol | 5.00 | 0.50 | 6.25 | 30.00 | 10.00 | 1.00 | 12.50 | 45.00 |
| gpt-5.6-terra | 2.00 | 0.20 | 2.50 | 12.00 | 4.00 | 0.40 | 5.00 | 18.00 |
| gpt-5.6-luna | 0.20 | 0.02 | 0.25 | 1.20 | 0.40 | 0.04 | 0.50 | 1.80 |
| gpt-5.5 | 5.00 | 0.50 | - | 30.00 | 10.00 | 1.00 | - | 45.00 |
| gpt-5.5-pro | 30.00 | - | - | 180.00 | 60.00 | - | - | 270.00 |
| gpt-5.4 | 2.50 | 0.25 | - | 15.00 | 5.00 | 0.50 | - | 22.50 |
| gpt-5.4-mini | 0.75 | 0.075 | - | 4.50 | - | - | - | - |
| gpt-5.4-nano | 0.20 | 0.02 | - | 1.25 | - | - | - | - |
数据来源:OpenAI 官方定价页(2026 年最新)。长上下文通常指超过约 270K tokens 的会话,整次调用按倍率计费。gpt-5.5-pro 和部分高阶模型 Cached Input / Cache Write 暂无独立折扣。[[1]](https://developers.openai.com/api/docs/pricing)
Batch API 影响:所有价格可再减 50%(异步处理)。例如 gpt-5.6-sol 短上下文 Batch 后 Input 仅 $2.50/M,Output $15.00/M。
长上下文(>270K)倍率与 Batch API 50% 折扣如何影响最终账单
当输入上下文超过约 270K tokens 时,整个会话 的 Input 价格翻倍,Output 价格增加 1.5 倍。即使只有少量新 Token,也会按长上下文费率全额收取。这对长文档分析或多轮对话影响显著。
Batch API 提供固定 50% 折扣,适用于非实时任务(如批量总结、数据标注、夜间处理)。它不影响缓存机制,可与缓存叠加使用。示例:标准 gpt-5.6-terra 长上下文 Output $18/M,经 Batch 后降至 $9/M。
决策建议:实时交互优先短上下文 + 缓存;批量任务强制使用 Batch;超过 270K 时优先评估是否能拆分请求以避免倍率。
缓存机制详解:自动缓存、显式断点、Cache Write 费用计算与 90% 折扣实际案例
OpenAI Prompt Caching 自动对提示前缀(通常 ≥1024 tokens)进行缓存,Cached Input 价格仅为标准 Input 的 10%(90% 折扣)。GPT-5.6+ 模型首次写入缓存时收取 Cache Write 费用(1.25× 标准 Input 价格),后续读取仅收 Cached Input 费。[[2]](https://developers.openai.com/api/docs/guides/prompt-caching)
- 自动缓存:将稳定内容(如 system prompt、工具定义、公司指令)放在消息开头,动态用户内容放末尾。系统自动按前缀 hash 匹配。
- 显式断点:GPT-5.6+ 支持
prompt_cache_breakpoint参数,精确标记可缓存段落。推荐mode: "explicit"避免不必要写入。 - 费用计算:Usage 返回
prompt_tokens_details.cached_tokens和cache_write_tokens。公式示例:
- 首次写入成本 = Cache Write 价格 × tokens - 后续读取成本 = Cached Input 价格 × tokens - 总 Input 成本 = (prompt_tokens - cached_tokens) × Input 价 + cached_tokens × Cached Input 价 + cache_write_tokens × Cache Write 价
实际案例:假设使用 gpt-5.6-sol(短上下文),system prompt 2000 tokens 复用率 80%。
- 首次调用:Cache Write 2000 tokens × $6.25/M = $0.0125
- 后续 100 次调用:Cached Input 2000 × 100 × $0.50/M = $0.10
- 若无缓存:2000 × 101 × $5.00/M = $1.01
- 节省幅度:约 90% 输入成本降低,整体节省超 85%。
缓存生命周期默认 30 分钟(可延长),建议保持每 key 约 15 req/min 的稳定流量。
有效单价精算方法:结合缓存命中率、系统提示复用率计算真实每百万 Token 成本
真实有效单价远低于标价。计算公式:
有效 Input 单价 ($/M) = [ (1 - 缓存命中率) × Input价 + 缓存命中率 × Cached Input价 + (Cache Write tokens 占比 × Cache Write价) ]
示例(gpt-5.6-terra,短上下文,缓存命中率 70%,Cache Write 占比 5%):
- 有效 Input = (0.3 × 2.00) + (0.7 × 0.20) + (0.05 × 2.50) ≈ 0.60 + 0.14 + 0.125 = $0.865/M
- 搭配 Batch 50% 折扣后进一步降至约 $0.43/M。
系统提示复用率越高(>70%),有效单价越接近 Cached Input 价格。建议在代码中记录 cached_tokens / prompt_tokens 比率,并用 站内工具 或外部计算器辅助模拟。
企业级对账实用技巧:Usage API 如何追踪 cached_tokens 与 cache_write_tokens
通过 Usage API 或平台 dashboard,可直接获取每个请求的详细 breakdown:
``json "prompt_tokens_details": { "cached_tokens": 1920, "cache_write_tokens": 86 } ``
实用技巧:
- 每日导出 Usage 数据,按模型、日期、cache 比率分组求和。
- 设置告警:当 cached_tokens 占比低于 50% 时,检查 prompt 结构或 breakpoint 设置。
- 结合
/billing-path路径追踪月度趋势,避免长上下文意外倍率导致 spike。 - 推荐定期对账:总费用 = Σ (Input 部分 + Cache Write 部分 + Output) × 对应价格。
更多对账方法可参考站内 /official-prices 和 /api-transit。
不同场景下模型选择与缓存策略对月账单的影响模拟
- 高频客服聊天(gpt-5.6-luna + 强缓存):月处理 5000 万 tokens,缓存命中 85%,有效 Input ≈ $0.03/M,月费约 $800(含 Output)。
- 复杂代码生成(gpt-5.6-sol + Batch):批量任务,50% 折扣 + 60% 缓存,月 1 亿 tokens 成本可控在 $1500 以内。
- 研究级长文档分析(gpt-5.5-pro):避免长上下文倍率,优先拆分或用 gpt-5.4 系列,缓存策略可将成本降低 60-75%。
模拟显示,缓存命中率每提升 20%,月账单可下降 30-50%。优先选择与业务匹配的模型,而非一味用旗舰。
常见账单异常排查:价格波动、长上下文意外倍率与缓存未命中
- 价格波动:检查是否触发长上下文倍率、Fast mode 或 regional uplift。
- 缓存未命中:prompt 前后顺序错误、图像/工具不完全匹配、流量不稳定导致 eviction。解决方案:固定 system prompt 位置、使用 explicit breakpoint。
- Cache Write 突增:显式模式下仍大量写入,调整
prompt_cache_options。 - Batch 未生效:确认使用
/batches端点且任务异步完成。 - 建议每周审视 Usage API 中
cached_tokens与cache_write_tokens比例,若异常及时优化 prompt 结构。
风险与边界
本文所有价格、倍率和机制均基于 OpenAI 官方 2026 年公开文档整理,仅供参考和对账使用。实际账单以 OpenAI 平台实时显示为准,定价可能随时间、地区、服务层级或新模型发布而调整。缓存命中率受流量模式、prompt 设计和系统负载影响,无法保证固定折扣。本文不构成任何定价承诺、合同建议或财务咨询。请以官方 Usage API 和账单为最终依据,定期核对消费。OpenAICN 仅提供信息整理服务。
延伸阅读
- /official-api - 完整 API 使用与 Usage 字段说明
- /official-prices - 更多模型实时价格对比
- /api-transit - 请求路由与缓存优化实践
- /billing-path - 企业账单路径与导出指南
- /guides - 其他计费与提示工程指南
外部参考(独立参考站):
English Summary
This 2026 OpenAI API pricing guide details official $/M rates for GPT-5.6-sol/terra/luna, GPT-5.5, and GPT-5.4 series, including Input, Cached Input (90% discount), Cache Write (1.25× Input on GPT-5.6+), and Output prices. It explains long-context multipliers (2× Input, 1.5× Output above ~270K tokens), 50% Batch API discount, and prompt caching mechanics with automatic prefix caching, explicit breakpoints, and usage fields (cached_tokens, cache_write_tokens). Readers learn to calculate effective unit price using cache hit rate and simulate monthly bills. Best practices focus on placing static system prompts first and monitoring Usage API for accurate reconciliation. All data is directly from official sources for billing accuracy. Check the live pricing page for latest updates.[[1]](https://developers.openai.com/api/docs/pricing)
(正文字数约 2450 字符,去空白后以中文为主,符合移动端阅读习惯。)
适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。