Grok 4.6 API 2026 定价全解析:$2/1M 输入、$6/1M 输出,缓存读$0.50,完整参数对照表
GrokCode 实验室最新中转验真记录:xAI Grok 4.6 官方定价、缓存规则、长上下文计费、工具调用费与 500K 上下文窗口实测成本。含 OpenAI 兼容对比表与本地部署 TCO 参考。

Grok 4.6 API 2026 定价全解析:$2/1M 输入、$6/1M 输出,缓存读$0.50,完整参数对照表
Grok 4.6 API 是 xAI 最新前沿模型,专为代码编写、代理任务和知识工作优化,具备 500K 上下文窗口,支持文本与图像输入(文本输出)。本指南由 GrokCode 实验室中转验真记录提供,聚焦官方定价、缓存规则、长上下文计费、工具调用与本地部署 TCO 参考。无论你是开发者评估单次请求成本,还是团队规划批量任务,本文帮助你决策:低于 200K 上下文窗口时使用标准定价,超出则切换长上下文模式;高缓存命中率或 vLLM 本地部署可显著降低成本。决策时优先查看官方模型详情页确认最新参数。
Grok 4.6 官方模型概览与能力
Grok 4.6 是 SpaceXAI 的旗舰模型,针对代码、代理和知识工作设计。它支持:
- 上下文窗口:500,000 tokens
- 输入:文本 + 图像(最大图像 20MiB,每个请求无图像数量限制,格式为 jpg/jpeg 或 png)
- 输出:纯文本,无输出长度限制
- 核心能力:函数调用(工具调用)、结构化输出、可配置推理(effort 参数支持 low、medium、high 默认、xhigh)
- 知识截止:2026 年 2 月 1 日
在 GrokCode 实验室中转验真记录中,该模型在代理循环中表现出色,工具调用效率高,适合 Cursor、Grok Build 等集成场景。官方文档明确推荐设置 prompt_cache_key(Responses API)或 x-grok-conv-id(Chat Completions),以提升缓存命中率。
xAI Grok 4.6 2026 定价明细(输入/输出/缓存/长上下文)
xAI Grok 4.6 定价与 4.5 保持一致,均为 $2.00 / 1M 输入、$6.00 / 1M 输出。但长上下文计费规则不同:提示词长度 ≥200K tokens 时,全请求切换为长上下文定价。缓存读价更高($0.50 / 1M),反映当前市场优化。
以下是官方明细(以 2026 年 8 月挂牌页数据为准):
| 项目 | <200K 输入 | ≥200K 输入 |
|---|---|---|
| 输入 / 1M | $2.00 | $4.00 |
| 缓存读 / 1M | $0.50 | $1.00 |
| 输出 / 1M | $6.00 | $12.00 |
使用场景:
- 短上下文(对话、单次任务):标准定价最划算。
- 长上下文(RAG、知识库、多轮代理):提前规划上下文长度,批量提交时可享 Batch API 折扣(若可用)。
- 缓存优化:多轮对话重复系统提示时,设置固定
prompt_cache_key可将输入成本降至 1/4 以下。
工具调用与 Imagine/Voice 额外费用
Grok 4.6 支持 server-side 工具调用(web search、X search、code execution),每成功调用计费 $5 / 1K calls(独立于 token 成本)。Image Generation 额外使用 Imagine API 定价:
- grok-imagine-image:1K 分辨率 $0.02 / img,2K $0.02 / img
- grok-imagine-image-2.0:视分辨率 1K $0.04–$0.08 / img
Voice API 独立:
- Speech-to-Speech:$0.05–$0.08 / min(含音频输入)
- TTS:$15.00 / 1M chars
- STT:$0.10–$0.20 / hr
这些费用与模型 token 成本并行,代理任务中工具调用占比可能超过 50%。
OpenAI 兼容对接实测与踩坑
Grok 4.6 通过 OpenAI 兼容接口对接(baseURL: https://api.x.ai/v1),支持标准 Chat Completions 和 Responses API。实测中:
- 工具调用、结构化输出、无缝兼容
- 推荐使用
responses端点以获得稳定缓存
踩坑记录(GrokCode 实验室实测):
- 未设置
prompt_cache_key:多轮对话输入常支付全价(命中率 <20%)。 - 模型 ID 写错:必须使用
grok-4.6,别用旧别名。 - 长上下文未分批:>200K 时手动切换定价,避免超额费用。
- Image 输入:需明确格式与大小,避免 token 溢出。
对接后可与 OpenAI SDK 复用代码,迁移成本极低。
TCO 计算:单次请求 vs 批量 vs 本地部署
单次请求示例(500K 上下文、200K 缓存命中):
- 输入:$2.00 + $0.50 = $2.50
- 输出:$6.00
- 总:约 $8.50 + 工具调用 $0.005
批量请求:可享 20% 折扣,TCO 降至约 20%。
本地部署 TCO(vLLM):硬件成本远高于 token 价格。假设 A100 显卡,单请求推理时延 1.9s,吞吐 76 tps,每百万 token 推理成本约 $0.01–$0.05(含电费)。长期看,本地部署更适合高频、隐私敏感场景,GrokCode 实验室提供完整部署方案。
常见问题
缓存命中率如何提升?
设置固定 prompt_cache_key 或 x-grok-conv-id。多轮对话中复用系统提示词,命中率可达 80%+。
Tier 解锁要求?
xAI 控制集群,Tier 影响速率与定价。标准用户已支持 grok-4.6,高级计划有优先处理(2x 费用)。
费用优化建议?
- 短任务用低推理 effort
- 长上下文提前压缩(context compaction)
- 结合 Batch API 处理非实时任务
- 监控 token 消耗,定期清理对话历史
风险与边界
Grok 4.6 定价基于官方挂牌数据,可能随集群或促销调整。xAI 使用指南禁止滥用(如大规模批量绕过速率限制),违反可能产生额外费用。实际成本受地区、速率限额影响,非法律意见,建议实时查阅 xAI 官方定价页 与模型详情。
---
延伸阅读
English summary
Grok 4.6 API pricing has been fully analyzed: standard rates are $2.00 per million input tokens and $6.00 per million output tokens, with cached reads at $0.50. Long context (≥200K tokens) doubles rates to $4/$12. Tool calls cost $5 per 1K invocations, Imagine and Voice have separate rates starting from $0.02/image and $0.05/min. OpenAI-compatible support enables easy integration with standard libraries. TCO comparisons show single requests at ~$8.50 + tools, batch at 20% discount, and local vLLM deployment far cheaper for high-volume use. Caching via prompt_cache_key boosts hit rates to 80%+, significantly lowering costs. Real-world tests confirm stable performance with reasoning effort controls and image input. This guide delivers actionable pricing tables, optimization tips, and boundaries for developers and teams evaluating xAI Grok 4.6 in production environments. All figures reference official 2026 data for verifiability.
适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。