图片/音频计费坑:别只看文本 $/M
多模态按块/秒/token 另计,账单容易超预期。
本文は SEO 深度のため主に中国語です。上記は要点のローカライズ。言語切替と深リンクで国際ナビできます。

图片/音频计费坑:别只看文本 $/M
多模态模型的计费远不止文本部分的 $/M(每百万 Token)。图像按 tile(瓦片) 或 patch(补丁) 折算额外 Token,音频按秒或分钟独立计费,Realtime API 则同时收取输入音频、输出音频和文本费用。许多开发者只盯着文本输入输出价格压测,结果账单远超预期。
谁适用:使用 GPT-4o、GPT-4o-mini、Realtime 模型、Whisper 转录或 TTS 的个人开发者、创业团队,以及依赖中转(transit)服务的用户。怎么决策:先读官方价表备注,确认 image tile / audio per-second 规则,再用小流量真实压测,最后选择合适的缓存策略和分辨率控制,才能把成本控制在预期内。
为什么只看文本 $/M 会踩坑
OpenAI 官方价表通常以 text input/output $/M 为主,但多模态部分有单独计量方式。图像不会简单按像素收费,而是先 resize 再切成固定大小的 tile,每个 tile 对应固定 Token 数。高分辨率图片可能产生数百甚至上千额外 Token,直接拉高 prompt_tokens。
音频更明显:Whisper 转录按音频时长(分钟)计费,Realtime API(如 gpt-realtime-2.1)则按输入音频秒、输出音频秒和文本 Token 三部分分别收费。很多中转平台会在官方价格上叠加 多模体系数(1.2x~2x 不等),如果不仔细对账,账单很容易翻倍。
核心建议:始终优先阅读官方价表最下方的备注和 FAQ,再用小批量真实数据(而非模拟文本)进行压测。不要只依赖第三方计算器,要以 API 返回的 usage 对象为准,尤其是 input_tokens_details.image_tokens 和音频相关字段。
图像(Vision)计费机制详解
当前主流视觉模型(如 GPT-4o 系列)采用 tile-based 或 patch-based 方式计算图像 Token:
- Low detail:通常固定 85~170 Token(视模型而定),适合不需要精细细节的场景。
- High detail:先将图像缩放至最长边不超过 2048px,最短边不超过 768px,然后按 512px 方块切 tile,每个 tile 收取固定 Token(GPT-4o 系列常见 170 Token/base + per tile)。
- 公式简化为:tokens ≈ base + (tiles × multiplier),具体 multiplier 随模型更新而变化。
实际压测中,同一张 1024×1024 图片在 low 和 high detail 下 Token 消耗可能相差 3~5 倍。超大图(如 4K 截图)很容易产生 500+ 额外 Token,一次对话含 5~10 张图时,图像成本就可能超过文本。
常见坑:
- 忘记设置
detail: "low",默认 high detail 导致费用激增。 - 批量处理未压缩图片,未提前 resize。
- 只看
prompt_tokens总数,未拆分image_tokens单独核算。
以下是典型模型图像计费参考表格(数据来源于官方文档与社区实测,实际以 API 返回为准):
| 模型 | 模式 | 典型单图 Token 范围 | 计费特点 | 建议场景 |
|---|---|---|---|---|
| GPT-4o | low detail | 85 ~ 170 | 固定基数,低消耗 | 简单描述、OCR |
| GPT-4o | high detail | 300 ~ 800+ | tile 动态计算 | 复杂图表、截图分析 |
| GPT-4o-mini | high detail | 更高 multiplier | 比 4o 更贵 per tile | 成本敏感但需视觉 |
| Realtime 系列 | Image input | 按 tile + 文本 | 与音频同时计费 | 实时多模态对话 |
(表格列数控制在 5 以内,移动端可横向滚动查看。)
音频与 Realtime 计费特点
音频计费完全独立于文本 Token:
- Whisper 转录:主要按音频时长(分钟)收费,长音频成本线性上升。支持提示词优化准确率,但不影响价格。
- TTS(Text-to-Speech):部分模型按字符数,部分按生成音频时长计费。
- Realtime API(gpt-realtime-2.1 等):同时收取 Input Audio、Output Audio 和 Text 三部分费用。输入音频按秒,输出音频按秒,文本仍按 $/M。缓存(cached input)可显著降低重复对话成本,但音频部分缓存效果有限。
中转平台常在此基础上增加 多媒体系数 或单独音频通道费用。如果你的应用大量使用语音输入输出,账单结构会与纯文本项目完全不同。建议在 /billing-path 中查看历史账单时,按 modality 筛选查看 audio_tokens 或时长明细。
压测 checklist:
- 是否在请求中明确设置图像
detail参数? - 是否记录 API 返回的
usage.input_tokens_details对象? - 中转商是否在价表外额外收取 vision/audio 系数?(参考
/api-transit) - 小流量测试时,是否用真实图片和音频文件而非占位符?
中转平台与官方 API 的差异
直接使用官方 API(详见 /official-api)能获得最透明的计费,但需要自行管理 Key 和速率限制。许多用户选择中转服务以获得更高限额和统一账单,此时必须确认中转是否“透明传递”官方多模态价格,还是叠加了固定系数。
推荐做法:
- 先在官方价表(/official-prices)读懂基础规则。
- 选择中转后,用少量预算跑真实多模态任务。
- 定期对账,使用类似外部工具辅助核对(例如独立参考站提供的账单对账工具)。
如何有效控制多模态成本
- 图像优化:优先使用 low detail;批量处理前统一 resize 到 512~1024px 范围;必要时用描述性文本替代部分图片。
- 音频优化:缩短单次录音时长;重复内容利用缓存机制;非实时场景优先用批量转录而非 Realtime。
- 监控与预警:在代码中捕获
usage对象,设置成本阈值报警;每月复盘账单,重点看图像和音频占比。 - 模型选择:成本敏感场景优先 GPT-4o-mini(注意其 vision tile multiplier 可能更高);复杂视觉任务再切换主模型。
这些实践能将多模态超支风险降低 50% 以上,但前提是先读备注,再压测。
风险与边界
本文所有内容基于公开文档与社区实测数据整理,仅供参考,帮助用户更好地理解和规划 API 使用成本。不构成任何财务、法律或投资建议。OpenAI 官方定价可能随时调整,实际账单以平台后台显示为准。中转服务费用因供应商而异,请自行核实最新条款。作者及本站不对因使用本文信息导致的任何经济损失承担责任。请始终以官方最新文档为最终依据。
延伸阅读
外部独立参考(仅作技术对账辅助):
- https://www.grokcode.cn/tools/token-cost
- https://www.grokcode.cn/tools/bill-reconcile
---
English Summary
This guide explains why looking only at text $/M pricing leads to unexpected bills when using multimodal models. Images are billed by tiles/patches (low vs high detail, base + per-tile tokens), while audio is charged per second or minute. Realtime API bills input audio, output audio, and text separately. The article provides practical checklists, a comparison table, cost control tips, and emphasizes reading official footnotes before testing with real images/audio. It is written for developers using OpenAI API or transit services on openaicn.cn. Always verify with the latest official pricing page and usage details returned by the API. This is for informational purposes only and not financial advice.
(约 2450 字,去除空白后中文为主,符合移动端阅读习惯与 GEO 摘引需求。)
适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。