Grok 4.6 xAI API 官方定价解析:输入$2 输出$6 缓存$0.5 上下文长传注意
2026年8月xAI Grok 4.6官方定价$2 input / $6 output per 1M tokens(<200K prompt),Grok 4.3 $1.25/$2.5,缓存机制详解与长上下文翻倍规则。
Full article body is primarily in Chinese for SEO depth; key points above are localized. Use the language switcher and deep links for global navigation.

Grok 4.6 xAI API 官方定价解析:输入$2 输出$6 缓存$0.5 上下文长传注意
Grok 4.6 是 xAI 2026 年 8 月推出的前沿模型,专为代码编写、代理任务和知识工作优化。输入价 $2 / 1M tokens,输出 $6 / 1M tokens,缓存输入 $0.5 / 1M tokens,上下文窗口 500,000 tokens。低于 200K prompt tokens 时享受标准费率,达到或超过该阈值则切换至长上下文阶梯(输入 $4、输出 $12、缓存 $1)。
此定价对个人开发者、中小团队及生产级应用最适用。如果你主要处理短提示或代理循环,缓存机制能显著降低成本;若涉及超长上下文或工具调用密集场景,则需优先优化提示长度以避免费率跃升。
Grok 4.6 vs 4.5 vs 4.3 模型定位
Grok 4.6 定位为当前旗舰模型,专攻代码和代理任务,具备可配置推理(低/中/高/xhigh)、结构化输出及极低幻觉率。其 500k 上下文窗口适合长上下文任务,性价比在同级模型中突出。相比 4.5,它在推理效率和工具调用上有所提升,输出质量更稳定。
4.5 作为 4.6 的前一代,价格完全一致(标准输入 $2、输出 $6),但上下文长传费率稍低(缓存 $0.3)。适合已有 4.5 工作负载的迁移者,无需改动代码即可切换。
4.3 仍是 1M 上下文老旗舰,输入 $1.25 / 输出 $2.5(标准),缓存 $0.2。长上下文(≥200k)下输入跳升至 $2.5、输出 $5。适用于对上下文长度要求极高但预算有限的场景。
| 模型 | 上下文 | 标准输入(/1M) | 标准输出(/1M) | 缓存输入(/1M) | 长上下文(≥200k)输入 | 长上下文输出 |
|---|---|---|---|---|---|---|
| 4.6 | 500k | $2.00 | $6.00 | $0.50 | $4.00 | $12.00 |
| 4.5 | 500k | $2.00 | $6.00 | $0.30 | $4.00 | $12.00 |
| 4.3 | 1M | $1.25 | $2.50 | $0.20 | $2.50 | $5.00 |
数据来源于 xAI 官方文档,2026 年 8 月 22 日挂牌。
上下文长度与定价阶梯表
xAI 将上下文分两个阶梯:提示长度 < 200,000 tokens 时应用标准费率;≥ 200,000 tokens 时,全请求(含输入、输出、缓存)按长上下文费率计费。这是为了平衡长上下文模型的价值与成本。
举例:一个 150k tokens 的提示按标准计费;一个 250k tokens 的提示,全按长上下文计费(输入 $4、输出 $12)。Grok 4.6 上下文上限 500k,因此超过 200k 阈值时必须谨慎管理提示长度。
缓存输入机制与折扣规则
xAI 支持 prompt caching,显著降低重复提示成本。标准缓存输入费率为 $0.5 / 1M tokens(低于 200k 提示时),长上下文下为 $1 / 1M tokens。启用方式:在 Responses API 中设置 prompt_cache_key,或在 Chat Completions API 中使用 x-grok-conv-id 头。
缓存仅对输入有效,输出和推理 token 不打折。配合上下文 compaction(上下文压缩)可进一步优化。实际效果:相同会话重复生成时,缓存命中率高可将输入成本降至 25% 以下。
工具调用与Responses API费用
Responses API 是 xAI 推荐的代理接口,支持工具调用(web_search、x_search、code_execution 等)。每个工具调用额外收费 $5 / 1,000 次调用(部分工具如 file_search 为 $2.50 / 1,000 次)。
Token 成本仍按模型费率计算,但服务器端工具调用不计入 token,仅计费。Code execution 等工具会消耗额外推理 token(按输出费率)。推荐在长代理循环中使用上下文 compaction 和 tool caching,避免多次相同工具调用。
生产成本估算与长上下文优化
生产环境估算以官方工具页为准。假设每日 1M tokens 输入 + 200k 输出,标准费率下月成本约 $2,200(不含工具调用)。启用缓存后,可降至 $1,100 左右。
长上下文优化关键:
- 严格控制提示长度 < 200k tokens
- 使用上下文压缩或分块 RAG
- 优先缓存历史对话
- 监控实际 token 消耗(xAI 提供 cost tracking 接口)
本地部署边界与vLLM搭配
xAI 官方 API 定价适用于远程调用。若需完全离线或降低成本,可使用 vLLM 在本地部署 Grok 权重。但 Grok 4.6 为闭源模型,官方未开放权重下载。社区级 vLLM 部署需绕过官方授权,属于法律灰色区,不推荐用于商业生产。
GrokCode 官方 API 中转服务提供合法代理:按官方费率 + 合理倍率分流请求,实现成本优化与高可用。建议直接参考 xAI 官方 API 文档 确认最新费率,或通过 GrokCode 的 API 中转页面 体验合法中转方案。
风险与边界
本指南基于 xAI 官方 2026 年 8 月数据,仅供参考。实际费用可能随地区、批量或促销调整。以官方文档或 GrokCode 实时仪表盘为准。vLLM 等本地部署方案若使用未授权权重,可能违反 xAI 服务条款,存在法律风险。
延伸阅读
English summary
Grok 4.6 from xAI is the 2026 flagship API model priced at $2 per million input tokens, $6 per million output tokens, and $0.5 cached input tokens for prompts under 200K tokens. It features a 500K context window and strong performance in coding and agentic tasks. Pricing jumps to $4 / $12 for longer prompts. Prompt caching and Responses API tool calls add usage-based extras, with server-side tools like web search costing $5 per 1,000 calls. Local vLLM deployment offers offline options but requires careful legal consideration for weight access. GrokCode provides legitimate API transit services for cost optimization and reliable access—check the official docs for the latest rates.
适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。