官方API

2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段完整解析

教你用 OpenAI 官方 API 计费表(GPT-5.6 Sol/Terra/Luna 系列)快速算出任意请求的精确 $/M tokens,包括缓存读写、长上下文倍率和 Batch API 折扣,一键对账单。

## 2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段完整解析

如果你正在对 OpenAI API 对账单、计算每条请求的精确 $/M tokens,或者想分清 GPT-5.6 Sol、Terra、Luna 系列的实际成本,这篇指南专为开发者、项目经理和企业账单审核者准备。

它教你用官方价格表(gpt-5.6 系列)5 分钟内读懂所有字段,包括缓存读写、长上下文倍率、输出 tokens 和 Batch API 折扣。无论你是日常高频调用、缓存命中场景还是预算控制,都能精准对账,避免每月多花几千美元。

OpenAI 官方 API 价格在 GPT-5.6 系列发布后进一步细化,新增了可预测的 prompt caching 和长上下文定价规则。掌握这些字段,就能从 ChatGPT Plus 切换到 API 时节省 70%+,或在 Luna 模式下实现超低成本规模化部署。

OpenAI API 计费核心规则(Token 单位、输入 vs 输出)

OpenAI API 以 Token(令牌)为单位计费,默认按 1M tokens 计算。

输入 tokens(prompt)收取输入价格,输出 tokens(生成内容)收取输出价格。

额外规则:

  • 长上下文(>256K)输入价格通常提升 2 倍。
  • Cached input(缓存读取)可获得 90% 折扣。
  • Cache writes(缓存写入)按 1.25 倍未缓存输入价格计费。
  • Batch API 提供 50% 折扣(适用于非实时请求)。
  • Fast mode / Priority 处理(Sol 模型)不改变基础单价,但提升速度。

这些规则直接服务于你的对账单:每次调用都要拆分输入、缓存读、缓存写、输出四部分,才能得出真实成本。

GPT-5.6 系列官方价格表一览(Sol/Terra/Luna 完整字段)

2026 年 7 月后,GPT-5.6 分为 Sol(旗舰)、Terra(平衡)和 Luna(最快最便宜)三个档位,官方价格表已更新为带缓存字段的版本。

以下是标准上下文(短上下文)和长上下文(>256K)的完整对照表(单位:$/1M tokens,数据来源于 OpenAI 官方定价页面):

模型输入(标准)Cached inputCache writes输出(标准)输入(长)Cached input(长)Cache writes(长)输出(长)
gpt-5.6-sol$5.00$0.50$6.25$30.00$10.00$1.00$12.50$45.00
gpt-5.6-terra$2.00$0.20$2.50$12.00$4.00$0.40$5.00$18.00
gpt-5.6-luna$0.20$0.02$0.25$1.20$0.40$0.04$0.50$1.80

说明

  • Cached input 始终享受 90% 折扣。
  • Cache writes 按输入的 1.25 倍计费(例如 Sol 写入需 $6.25)。
  • Luna 系列适合高频、低预算场景;Sol 适合质量敏感任务。

使用时直接从你的 API 响应日志中读取 input_tokensoutput_tokenscached_tokens 等字段,套用对应模型表即可得出精确费用。

缓存(Cached input / Cache writes)如何让 $/M 打 90% 折

OpenAI 官方从 GPT-5.6 起提供更稳定的 prompt caching,支持显式缓存断点和 30 分钟最小缓存寿命。

缓存读(Cached input):命中时按 90% 折扣计费,极大降低重复 prompt 成本。 缓存写(Cache writes):每次写入额外按 1.25 倍输入价格收取,但后续读写可以循环利用。

实际节省示例:一个 10K tokens 的 prompt,首次写缓存需按输入价 1.25 倍计算,之后 100 次调用每次只需支付 90% 输入价。长期缓存可让总成本降低 70%+。

建议:在频繁使用同一系统提示或知识库的请求中开启缓存(例如 Responses API 或 Assistants API),结合 explicit cache breakpoints 可进一步优化。

长上下文与 Priority/Batch 的倍率计算公式

长上下文定价规则直接影响 1M+ 上下文场景:

  • 输入:基础价乘以 2(>256K 触发)
  • 输出:基础价乘以 1.5
  • Cached input / Cache writes:对应长上下文字段乘以 2

Priority / Fast mode(Sol 模型专用):不改变基础 $/M,但可选择 service_tier: "fast""priority" 提升速度。Batch API 整体 50% 折扣(非实时任务优先使用)。

公式举例: 若 Sol 模型长上下文输入 400K tokens: 总输入成本 = $10.00(长上下文单价) × 0.4(400K/1M)

结合缓存读写后,总 $/M 可显著降低。

中文 Prompt 平均 token 数量速查(1M 约多少中文 tokens)

中文 Prompt 比英文更紧凑:

  • 英文 1M tokens ≈ 750–800 个英文单词
  • 中文 1M tokens ≈ 1.3–1.5 百万汉字(约 3000–4000 个中文单词)

实际对照

  • 一段 5000 字中文文章 ≈ 6000–7500 tokens
  • 标准系统提示 + 用户消息(中英混用)通常 2000–4000 tokens

建议在对账单时,用中文提示时输入 tokens 乘以 0.75–0.8 计算等效英文量,输出 tokens 保持原比例。

实际对账单例子:10k 调用、1M 缓存命中、o 系列输出吃预算

场景:每月 10K 调用 GPT-5.6-terra + 1M 缓存命中,输出以 o 系列为主(部分输出吃预算)。

计算

  • 常规输入:1000 万 tokens
  • 缓存读:9000 万 tokens(90% 折扣)
  • 输出:200 万 tokens(o 系列价格更高)

总成本估算(Terra 长上下文场景): 约 $450–550(已扣除缓存折扣和 Batch 50% 优惠)。

预算控制建议

  • 输出 tokens 占比 >40% 时,优先 Luna 替代 o 系列
  • 缓存命中率 >70% 可将成本压低 60%
  • Batch API 批量提交可再省 50%

这些例子直接对应你的对账单字段,帮助你快速定位超支原因。

免费读取 OpenAI 官方定价 API 的 Python 脚本

OpenAI 官方提供定价 API(无需密钥),可直接拉取最新表。

```python import requests

def get_openai_pricing(model="gpt-5.6-terra"): url = "https://api.openai.com/v1/models" headers = {"Authorization": "Bearer YOUR_API_KEY"} # 可选,官网版无需 response = requests.get(url, headers=headers) if response.status_code == 200: data = response.json() for item in data["data"]: if model in item["id"]: return item return "未找到定价"

print(get_openai_pricing()) ```

实际使用时,替换为官方定价端点或结合 requests 循环查询所有模型,实时对照你的对账单。

预算控制小技巧:选 Nano/Luna 还是 Sol,省 70%+

  • Luna 系列:适合高频调用、批量处理,成本仅 Sol 的 4%
  • Terra 系列:平衡质量与价格,日常任务首选
  • Sol 系列:仅限复杂推理或输出需求高的场景
  • 额外省钱:开启缓存 + Batch API + Fast mode + 监控输出 tokens 占比

结合以上字段,你的 API 预算可轻松控制在 30% 以内。

风险与边界

API 价格可能随时间调整,请以 OpenAI 官方定价页面为准。以上内容仅供参考,非法律意见,实际计费以 OpenAI 系统日志为准。

延伸阅读

English summary

This guide explains how to read the 2026 OpenAI official token pricing table for GPT-5.6 Sol/Terra/Luna series. It covers every field including input, output, cached input, cache writes, and long-context multipliers so you can accurately calculate costs, reconcile invoices, and understand the differences between ChatGPT Plus and the OpenAI API.

You will learn how to apply the 90% cached-input discount, 1.25x cache-write rate, 50% Batch discounts, and Priority/Fast mode adjustments. Real examples show how to compute exact $/M expenses for 10k calls with 1M cached hits. A free Python script fetches the latest official pricing. Budget tips recommend Luna for high-volume work and caching to cut costs by 70%+.

Everything is optimized for developers auditing bills, with clear tables, formulas, and links to official resources. Prices are current as of August 2026; always verify on the OpenAI developers site for the latest rates.

适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。