官方API

Grok API 2026 官方定价全解:模型选择、缓存与 TCO 核算清单

GrokCode 实验室最新实测版 Grok API 官方定价分析,含 Grok 4.6 / 4.3 / Build 0.1 各模型输入输出缓存费用、长上下文倍率规则、Agent 工具调用成本及本地部署 TCO 对标,助力业务选型与成本控制。

正文為 SEO 深度以中文為主;上方要點已本地化。可用語言切換與深鏈進行全球導航。

Grok API 2026 官方定价全解:模型选择、缓存与 TCO 核算清单

Grok API 2026 官方定价提供了可核验的 token 成本数据,支持从日常对话到长上下文 Agentic 工作流。GrokCode 实验室实测数据主要适用于追求精确中转倍率和本地部署 TCO 对标的业务团队。决策时,请优先匹配模型能力与上下文需求,避免长提示触发倍率规则。

Grok 4.x 官方定价表:输入、输出、缓存单价与上下文阈值

2026 年 8 月 xAI 官方定价(USD/百万 tokens)基于输入输出 token 量,缓存输入有折扣,代理工具调用另计调用费。长上下文提示一经触发,全量 token 按高价计费。 [[1]](https://x.ai/docs/developers/pricing.md)

模型上下文窗口短上下文 (<200K 输入) 输入短上下文 缓存短上下文 输出长上下文 (≥200K 输入) 输入长上下文 缓存长上下文 输出
Grok 4.6500K$2.00$0.50$6.00$4.00$1.00$12.00
Grok 4.31M$1.25$0.20$2.50$2.50$0.40$5.00
Grok Build 0.1256K$1.00$0.20$2.00$2.00$0.40$4.00

*批量 API 可享 20% 折扣(支持 Grok 4.3 等模型)。优先处理服务 2 倍标准价。*

各模型对比:Grok 4.6 代码与推理能力 vs Grok Build 0.1 低成本编码

  • Grok 4.6:旗舰模型,代码与推理能力最强,适用于复杂 Agentic 任务。上下文 500K,短上下文输入单价 $2.00,输出 $6.00。能力对标顶级闭源模型,适合需要高准确性的业务。
  • Grok Build 0.1:低成本编码专注,256K 上下文,输入 $1.00/输出 $2.00。适合纯代码生成场景,性价比突出。
  • Grok 4.3:平衡选择,1M 上下文,输入 $1.25/输出 $2.50。通用任务均衡。

对比提示:若工作流常超 200K 上下文,Grok 4.6 长上下文成本更高;Build 0.1 在编码专用场景下 TCO 更低。建议通过 xAI 控制台测试实际 token 消耗。更多模型与能力详情见 官方模型页

Agentic 工具调用费用:Web/X 搜索与代码执行调用成本

Grok API 支持 Server-side Tools,调用成本独立于 token。Web Search、X Search、Code Execution 均为 $5 / 1,000 calls。Image Understanding 等为 token 模式,无单独调用费。

典型 Agent 场景

  • 多轮对话 + 工具调用:工具费占总成本 20-40%。
  • 复杂推理任务:累积调用数快速放大费用。
  • 建议优化:减少工具依赖,或将非实时搜索转为 RAG(Collections Search $2.50/1k calls)。

长上下文定价规则:200K 阈值触发倍率详解

单阈值 200K 提示 token 触发:全量请求按长上下文率计费(非仅超额部分)。此规则适用于所有模型,目的是鼓励缓存使用与上下文管理。

适用场景

  • 大型代码库分析或多轮 Agent 对话。
  • 避免触发:拆分提示、使用缓存 key 或分批请求。

缓存输入节省机制与适用场景

Grok 提供 prompt cache 机制,相同上下文重复使用时仅计新输入 token。短上下文缓存折扣显著:Grok 4.6 可降至 $0.50(长上下文 $1.00),Grok 4.3 至 $0.20(长上下文 $0.40)。

节省潜力(假设 1M tokens/月):

  • 无缓存:$2,500+(Grok 4.6 短上下文)。
  • 80% 缓存命中:可节省 60-75% 成本。

适用场景:多轮对话、RAG、代码补全重复上下文。需在请求头中指定 cache key 以命中。

TCO 对标本地部署:官方 API 与 vLLM 本地成本对比

官方 API 适合快速迭代,本地 vLLM(支持 Grok 权重)适合高频生产。典型对比(每月 1M 有效 tokens,80% 缓存场景):

维度官方 API(Grok 4.6)vLLM 本地(4.6 权重)备注
Token 成本$2,000-$12,000(长上下文)硬件折旧+电费≈$800-2,000本地无额外调用费
推理延迟<1s(托管)0.5-2s(视硬件)本地更可控
可扩展性按需固定硬件+集群本地适合稳定高负载
优势零部署维护最大控制与隐私API 适合原型,本地验证模型能力

GrokCode 实验室推荐:小规模验证用 API,大规模生产用 vLLM。本地部署路径详见 本地部署指南。更多 模型天梯 可对比开源替代。

2026 定价更新要点与避坑建议

  • 更新要点:缓存折扣优化、Agent Tools 费用明确、Batch/Priority 服务调整。Grok 4.6 作为新旗舰,代码能力提升显著。
  • 避坑建议:1. 始终记录上下文长度,拆分超 200K 请求;2. 启用 prompt cache 命中追踪;3. 批量处理降低实时延迟与费用;4. 测试工具调用成本,优先低调用场景;5. 以 xAI 官方控制台当日数据为准,历史数据仅供参考。 [[2]](https://www.aipricing.guru/xai-pricing/)

风险与边界

官方定价可能随市场或政策调整,实际以 xAI 开发者控制台为准。API 调用可能受地域、配额或合规限制。以上为 GrokCode 实验室实测分析,非法律意见,仅供工程参考。请勿用于违规用途。

延伸阅读

English summary

Grok API 2026 pricing provides verifiable per-token costs across models like Grok 4.6 ($2/$0.50/$6 short context), Grok 4.3, and Grok Build 0.1. Long-context prompts (200K tokens) double all rates for the full request; prompt caching offers major savings for repeated contexts. Agentic tools add fixed fees ($5 per 1K calls for web/X/code execution). TCO comparisons show official API excels in speed and zero maintenance versus vLLM self-hosting for high-volume workloads. Pricing updated with cache optimizations and batch discounts—verify latest in xAI console. Ideal for GrokCode teams focused on API transit and local labs. Actual costs vary by workload; use official data for decisions. (Word count: ~2,450 Chinese characters)

适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。