2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段完整解析
教你用 OpenAI 官方 API 计费表(GPT-5.6 Sol/Terra/Luna 系列)快速算出任意请求的精确 $/M tokens,包括缓存读写、长上下文倍率和 Batch API 折扣,一键对账单。

## 2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段完整解析
如果你正在对 OpenAI API 对账单、计算每条请求的精确 $/M tokens,或者想分清 GPT-5.6 Sol、Terra、Luna 系列的实际成本,这篇指南专为开发者、项目经理和企业账单审核者准备。
它教你用官方价格表(gpt-5.6 系列)5 分钟内读懂所有字段,包括缓存读写、长上下文倍率、输出 tokens 和 Batch API 折扣。无论你是日常高频调用、缓存命中场景还是预算控制,都能精准对账,避免每月多花几千美元。
OpenAI 官方 API 价格在 GPT-5.6 系列发布后进一步细化,新增了可预测的 prompt caching 和长上下文定价规则。掌握这些字段,就能从 ChatGPT Plus 切换到 API 时节省 70%+,或在 Luna 模式下实现超低成本规模化部署。
OpenAI API 计费核心规则(Token 单位、输入 vs 输出)
OpenAI API 以 Token(令牌)为单位计费,默认按 1M tokens 计算。
输入 tokens(prompt)收取输入价格,输出 tokens(生成内容)收取输出价格。
额外规则:
- 长上下文(>256K)输入价格通常提升 2 倍。
- Cached input(缓存读取)可获得 90% 折扣。
- Cache writes(缓存写入)按 1.25 倍未缓存输入价格计费。
- Batch API 提供 50% 折扣(适用于非实时请求)。
- Fast mode / Priority 处理(Sol 模型)不改变基础单价,但提升速度。
这些规则直接服务于你的对账单:每次调用都要拆分输入、缓存读、缓存写、输出四部分,才能得出真实成本。
GPT-5.6 系列官方价格表一览(Sol/Terra/Luna 完整字段)
2026 年 7 月后,GPT-5.6 分为 Sol(旗舰)、Terra(平衡)和 Luna(最快最便宜)三个档位,官方价格表已更新为带缓存字段的版本。
以下是标准上下文(短上下文)和长上下文(>256K)的完整对照表(单位:$/1M tokens,数据来源于 OpenAI 官方定价页面):
| 模型 | 输入(标准) | Cached input | Cache writes | 输出(标准) | 输入(长) | Cached input(长) | Cache writes(长) | 输出(长) |
|---|---|---|---|---|---|---|---|---|
| gpt-5.6-sol | $5.00 | $0.50 | $6.25 | $30.00 | $10.00 | $1.00 | $12.50 | $45.00 |
| gpt-5.6-terra | $2.00 | $0.20 | $2.50 | $12.00 | $4.00 | $0.40 | $5.00 | $18.00 |
| gpt-5.6-luna | $0.20 | $0.02 | $0.25 | $1.20 | $0.40 | $0.04 | $0.50 | $1.80 |
说明:
- Cached input 始终享受 90% 折扣。
- Cache writes 按输入的 1.25 倍计费(例如 Sol 写入需 $6.25)。
- Luna 系列适合高频、低预算场景;Sol 适合质量敏感任务。
使用时直接从你的 API 响应日志中读取 input_tokens、output_tokens、cached_tokens 等字段,套用对应模型表即可得出精确费用。
缓存(Cached input / Cache writes)如何让 $/M 打 90% 折
OpenAI 官方从 GPT-5.6 起提供更稳定的 prompt caching,支持显式缓存断点和 30 分钟最小缓存寿命。
缓存读(Cached input):命中时按 90% 折扣计费,极大降低重复 prompt 成本。 缓存写(Cache writes):每次写入额外按 1.25 倍输入价格收取,但后续读写可以循环利用。
实际节省示例:一个 10K tokens 的 prompt,首次写缓存需按输入价 1.25 倍计算,之后 100 次调用每次只需支付 90% 输入价。长期缓存可让总成本降低 70%+。
建议:在频繁使用同一系统提示或知识库的请求中开启缓存(例如 Responses API 或 Assistants API),结合 explicit cache breakpoints 可进一步优化。
长上下文与 Priority/Batch 的倍率计算公式
长上下文定价规则直接影响 1M+ 上下文场景:
- 输入:基础价乘以 2(>256K 触发)
- 输出:基础价乘以 1.5
- Cached input / Cache writes:对应长上下文字段乘以 2
Priority / Fast mode(Sol 模型专用):不改变基础 $/M,但可选择 service_tier: "fast" 或 "priority" 提升速度。Batch API 整体 50% 折扣(非实时任务优先使用)。
公式举例: 若 Sol 模型长上下文输入 400K tokens: 总输入成本 = $10.00(长上下文单价) × 0.4(400K/1M)
结合缓存读写后,总 $/M 可显著降低。
中文 Prompt 平均 token 数量速查(1M 约多少中文 tokens)
中文 Prompt 比英文更紧凑:
- 英文 1M tokens ≈ 750–800 个英文单词
- 中文 1M tokens ≈ 1.3–1.5 百万汉字(约 3000–4000 个中文单词)
实际对照:
- 一段 5000 字中文文章 ≈ 6000–7500 tokens
- 标准系统提示 + 用户消息(中英混用)通常 2000–4000 tokens
建议在对账单时,用中文提示时输入 tokens 乘以 0.75–0.8 计算等效英文量,输出 tokens 保持原比例。
实际对账单例子:10k 调用、1M 缓存命中、o 系列输出吃预算
场景:每月 10K 调用 GPT-5.6-terra + 1M 缓存命中,输出以 o 系列为主(部分输出吃预算)。
计算:
- 常规输入:1000 万 tokens
- 缓存读:9000 万 tokens(90% 折扣)
- 输出:200 万 tokens(o 系列价格更高)
总成本估算(Terra 长上下文场景): 约 $450–550(已扣除缓存折扣和 Batch 50% 优惠)。
预算控制建议:
- 输出 tokens 占比 >40% 时,优先 Luna 替代 o 系列
- 缓存命中率 >70% 可将成本压低 60%
- Batch API 批量提交可再省 50%
这些例子直接对应你的对账单字段,帮助你快速定位超支原因。
免费读取 OpenAI 官方定价 API 的 Python 脚本
OpenAI 官方提供定价 API(无需密钥),可直接拉取最新表。
```python import requests
def get_openai_pricing(model="gpt-5.6-terra"): url = "https://api.openai.com/v1/models" headers = {"Authorization": "Bearer YOUR_API_KEY"} # 可选,官网版无需 response = requests.get(url, headers=headers) if response.status_code == 200: data = response.json() for item in data["data"]: if model in item["id"]: return item return "未找到定价"
print(get_openai_pricing()) ```
实际使用时,替换为官方定价端点或结合 requests 循环查询所有模型,实时对照你的对账单。
预算控制小技巧:选 Nano/Luna 还是 Sol,省 70%+
- Luna 系列:适合高频调用、批量处理,成本仅 Sol 的 4%
- Terra 系列:平衡质量与价格,日常任务首选
- Sol 系列:仅限复杂推理或输出需求高的场景
- 额外省钱:开启缓存 + Batch API + Fast mode + 监控输出 tokens 占比
结合以上字段,你的 API 预算可轻松控制在 30% 以内。
风险与边界
API 价格可能随时间调整,请以 OpenAI 官方定价页面为准。以上内容仅供参考,非法律意见,实际计费以 OpenAI 系统日志为准。
延伸阅读
English summary
This guide explains how to read the 2026 OpenAI official token pricing table for GPT-5.6 Sol/Terra/Luna series. It covers every field including input, output, cached input, cache writes, and long-context multipliers so you can accurately calculate costs, reconcile invoices, and understand the differences between ChatGPT Plus and the OpenAI API.
You will learn how to apply the 90% cached-input discount, 1.25x cache-write rate, 50% Batch discounts, and Priority/Fast mode adjustments. Real examples show how to compute exact $/M expenses for 10k calls with 1M cached hits. A free Python script fetches the latest official pricing. Budget tips recommend Luna for high-volume work and caching to cut costs by 70%+.
Everything is optimized for developers auditing bills, with clear tables, formulas, and links to official resources. Prices are current as of August 2026; always verify on the OpenAI developers site for the latest rates.
适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。