官方 API入门7 分钟

官方 API Token 计费入门

输入/输出/缓存单价、$/M 含义与粗算成本。

单位 $/M

API Token 计费以 $/M(美元每百万 tokens)为最基本单位。这是所有主流官方订阅 API 的标准计量方式,包括 OpenAI、xAI Grok、Moonshot Kimi、火山引擎(豆包)、Groq 和部分腾讯 Hunyuan 系列。 “$/M” 表示“每百万 tokens 消耗 1 美元”。输入(Input)和输出(Output)价格分别独立计算,输出通常是输入的 5–20 倍。

常见字段拆解

  • Input:用户提示词(prompt)占用的 tokens。
  • Output:模型生成的回复占用的 tokens。
  • Cached:上下文缓存命中(Cache Hit)或写入(Cache Write)的 tokens。
  • Batch:批量任务(Batch API)价格通常为标准价的 50%–60%,适合高量离线任务。

这些字段在官方定价页(如 OpenAI developers.openai.com/api/docs/pricing、Kimi platform.kimi.ai/docs/pricing、火山引擎 volcengine.com/docs)都有明确表格,支持精确核算。

常见字段

  1. Input / Output

标准聊天补全(Chat Completion)必选字段。单价浮动由模型能力、上下文长度、实时性决定。

  1. Cache Hit / Cache Write

现代 API(OpenAI、Kimi、火山)提供上下文缓存功能。Cache Hit 价格远低于普通 Input(常为 1/10–1/30),适合对话历史复用场景。

  1. Batch / Streaming

Batch 定价更低,适用于批量生成任务。Streaming 通常按实时 token 计费,与标准一致。

  1. 额外扩展字段(视模型而定)

- Vision / Audio / Image:多模态 token 价格。 - Reasoning Effort:某些模型(OpenAI o-series、xAI)支持不同推理级别,价格阶梯递增。 - Region:数据驻留端点(Data Residency)可能加 10% 费用(OpenAI 2026 年 3 月 5 日后部分模型)。

粗算成本

公式: 总成本(USD) = Input(M)× Input 单价 + Output(M)× Output 单价 + Cache Hit(M)× Hit 单价 + Cache Write(M)× Write 单价

示例 1:中等量对话(OpenAI gpt-5.4-terra)

  • 每日提示词 10 万 tokens(Input),回复 5 万 tokens(Output)
  • 缓存命中率 40%,每日缓存命中 4 万 tokens
  • 单价:Input $2.50,Output $15.00,Hit $0.50,Write $6.25

成本 = 0.1 × 2.5 + 0.05 × 15 + 0.04 × 0.5 + 0.01 × 6.25 = 0.25 + 0.75 + 0.02 + 0.0625 = $1.0625 / 天 全年约 $388(不含税)。

示例 2:高量生产场景(Kimi K3)

  • 日均 50 万输入 + 200 万输出,缓存命中率 60%
  • 单价:Input $3.00,Output $15.00,Hit $0.30

成本 = 0.5 × 3 + 2 × 15 + 1.2 × 0.3 = 1.5 + 30 + 0.36 = $31.86 / 天 全年约 $11,639(前置已抵扣 60% 缓存)。

表格:2026 年部分主流官方 API 基准单价(USD / 百万 tokens)

模型 / 平台Input 单价Output 单价Cache Hit 单价适用场景示例备注
OpenAI gpt-5.4-terra$2.50$15.00$0.50通用对话、Agent标准版,无缓存折扣
OpenAI o4-mini$0.55$2.20-轻量任务、分类、路由极致性价比
xAI Grok-4.5$2.00$6.00$0.30复杂推理、长上下文代码旗舰模型,推理模式可选
Moonshot Kimi K3$3.00$15.00$0.30实时对话、AgentCache Hit 极低
Moonshot K2.6$0.95$4.00$0.16平衡任务、编码中低价
火山引擎 Doubao6.00 元30.00 元1.20 元中文优先、视频/语音任务国内合规,人民币计费
Groq Llama 3.3 70B$0.59$0.79-高速推理、测试原型TPS 极高

提示:以上为 2026 年 7 月官方最新基准价,实际以各平台控制台显示为准。缓存命中率越高,总成本可降低 30%–70%。

缓存与阶梯

缓存机制: 现代 API 支持预加载对话历史、RAG 数据或系统提示词。Cache Hit 价格远低于普通 Input,Cache Write 价格高于普通 Input(约 2–4 倍)。合理利用缓存可显著降低月度费用。

阶梯价格示例(以 OpenAI 为例):

  • 基础版:标准 $/M
  • Cache Hit:1/5–1/30 标准 Input
  • Reasoning Effort:非思考模式 vs 高思考模式(输出价格 2–3 倍)
  • Batch:标准 50%

阶梯优化技巧

  1. 短上下文场景优先 Cache Hit。
  2. 长期会话使用模型内置缓存(OpenAI)或手动 KV Cache。
  3. 批量任务切换 Batch API。
  4. 结合 OpenAI-compatible 转换层(如 GrokCode 提供的 /official-api 模块),统一接入多平台同一定价逻辑。

和中转怎么比

官方订阅 $/M 是纯合规、SLA 保障的底层价格。中转站综合倍率通常为 1.5–4.0 倍(含稳定性、限流、部署风险),具体取决于平台、地区和当前市场。

对比示例(OpenAI gpt-5.4-terra)

  • 官方:$2.50 Input / $15 Output
  • 中转综合倍率 2.5 倍:相当于 $6.25 Input / $37.5 Output
  • GrokCode 聚合站点实时显示:官方价 + 中转卡网/官方 Token 中转价 + 官方 API Token 倍率,可直观看到“官方价 vs 中转价”差额。

建议:日常高频请求优先官方订阅;低频、测试或突发高峰使用中转。查看 GrokCode /official-prices 或 /api-transit 模块可实时对比。

风险与边界

使用官方 API Token 必须遵守各平台 Terms of Service,包括反滥用、数据不用于训练及反欺诈政策。

  • 账户封禁风险:高频请求或批量绕过风控可能触发。
  • 隐私风险:敏感数据上传至云端需评估 GDPR/CCPA 等。
  • 价格波动:官方价格会随模型迭代调整,建议启用预算告警。
  • 合规提醒:非法律意见,建议咨询专业合规顾问。
  • 防御性安全:仅存储凭证于加密环境,使用官方提供的 API Key 管理工具,避免公开暴露。
  • 限流与重试:官方文档明确 Rate Limit,合理处理 429 错误是必备运维知识。

延伸阅读

通过 GrokCode /official-api 模块,您可一键查看各平台官方 Token 实时价格与中转对比,帮助您在合规前提下实现成本与性能的最优平衡。

适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。