Grok API 2026 官方定价全解:模型选择、缓存与 TCO 核算清单
GrokCode 实验室最新实测版 Grok API 官方定价分析,含 Grok 4.6 / 4.3 / Build 0.1 各模型输入输出缓存费用、长上下文倍率规则、Agent 工具调用成本及本地部署 TCO 对标,助力业务选型与成本控制。
Full article body is primarily in Chinese for SEO depth; key points above are localized. Use the language switcher and deep links for global navigation.

Grok API 2026 官方定价全解:模型选择、缓存与 TCO 核算清单
Grok API 2026 官方定价提供了可核验的 token 成本数据,支持从日常对话到长上下文 Agentic 工作流。GrokCode 实验室实测数据主要适用于追求精确中转倍率和本地部署 TCO 对标的业务团队。决策时,请优先匹配模型能力与上下文需求,避免长提示触发倍率规则。
Grok 4.x 官方定价表:输入、输出、缓存单价与上下文阈值
2026 年 8 月 xAI 官方定价(USD/百万 tokens)基于输入输出 token 量,缓存输入有折扣,代理工具调用另计调用费。长上下文提示一经触发,全量 token 按高价计费。 [[1]](https://x.ai/docs/developers/pricing.md)
| 模型 | 上下文窗口 | 短上下文 (<200K 输入) 输入 | 短上下文 缓存 | 短上下文 输出 | 长上下文 (≥200K 输入) 输入 | 长上下文 缓存 | 长上下文 输出 |
|---|---|---|---|---|---|---|---|
| Grok 4.6 | 500K | $2.00 | $0.50 | $6.00 | $4.00 | $1.00 | $12.00 |
| Grok 4.3 | 1M | $1.25 | $0.20 | $2.50 | $2.50 | $0.40 | $5.00 |
| Grok Build 0.1 | 256K | $1.00 | $0.20 | $2.00 | $2.00 | $0.40 | $4.00 |
*批量 API 可享 20% 折扣(支持 Grok 4.3 等模型)。优先处理服务 2 倍标准价。*
各模型对比:Grok 4.6 代码与推理能力 vs Grok Build 0.1 低成本编码
- Grok 4.6:旗舰模型,代码与推理能力最强,适用于复杂 Agentic 任务。上下文 500K,短上下文输入单价 $2.00,输出 $6.00。能力对标顶级闭源模型,适合需要高准确性的业务。
- Grok Build 0.1:低成本编码专注,256K 上下文,输入 $1.00/输出 $2.00。适合纯代码生成场景,性价比突出。
- Grok 4.3:平衡选择,1M 上下文,输入 $1.25/输出 $2.50。通用任务均衡。
对比提示:若工作流常超 200K 上下文,Grok 4.6 长上下文成本更高;Build 0.1 在编码专用场景下 TCO 更低。建议通过 xAI 控制台测试实际 token 消耗。更多模型与能力详情见 官方模型页。
Agentic 工具调用费用:Web/X 搜索与代码执行调用成本
Grok API 支持 Server-side Tools,调用成本独立于 token。Web Search、X Search、Code Execution 均为 $5 / 1,000 calls。Image Understanding 等为 token 模式,无单独调用费。
典型 Agent 场景:
- 多轮对话 + 工具调用:工具费占总成本 20-40%。
- 复杂推理任务:累积调用数快速放大费用。
- 建议优化:减少工具依赖,或将非实时搜索转为 RAG(Collections Search $2.50/1k calls)。
长上下文定价规则:200K 阈值触发倍率详解
单阈值 200K 提示 token 触发:全量请求按长上下文率计费(非仅超额部分)。此规则适用于所有模型,目的是鼓励缓存使用与上下文管理。
适用场景:
- 大型代码库分析或多轮 Agent 对话。
- 避免触发:拆分提示、使用缓存 key 或分批请求。
缓存输入节省机制与适用场景
Grok 提供 prompt cache 机制,相同上下文重复使用时仅计新输入 token。短上下文缓存折扣显著:Grok 4.6 可降至 $0.50(长上下文 $1.00),Grok 4.3 至 $0.20(长上下文 $0.40)。
节省潜力(假设 1M tokens/月):
- 无缓存:$2,500+(Grok 4.6 短上下文)。
- 80% 缓存命中:可节省 60-75% 成本。
适用场景:多轮对话、RAG、代码补全重复上下文。需在请求头中指定 cache key 以命中。
TCO 对标本地部署:官方 API 与 vLLM 本地成本对比
官方 API 适合快速迭代,本地 vLLM(支持 Grok 权重)适合高频生产。典型对比(每月 1M 有效 tokens,80% 缓存场景):
| 维度 | 官方 API(Grok 4.6) | vLLM 本地(4.6 权重) | 备注 |
|---|---|---|---|
| Token 成本 | $2,000-$12,000(长上下文) | 硬件折旧+电费≈$800-2,000 | 本地无额外调用费 |
| 推理延迟 | <1s(托管) | 0.5-2s(视硬件) | 本地更可控 |
| 可扩展性 | 按需 | 固定硬件+集群 | 本地适合稳定高负载 |
| 优势 | 零部署维护 | 最大控制与隐私 | API 适合原型,本地验证模型能力 |
GrokCode 实验室推荐:小规模验证用 API,大规模生产用 vLLM。本地部署路径详见 本地部署指南。更多 模型天梯 可对比开源替代。
2026 定价更新要点与避坑建议
- 更新要点:缓存折扣优化、Agent Tools 费用明确、Batch/Priority 服务调整。Grok 4.6 作为新旗舰,代码能力提升显著。
- 避坑建议:1. 始终记录上下文长度,拆分超 200K 请求;2. 启用 prompt cache 命中追踪;3. 批量处理降低实时延迟与费用;4. 测试工具调用成本,优先低调用场景;5. 以 xAI 官方控制台当日数据为准,历史数据仅供参考。 [[2]](https://www.aipricing.guru/xai-pricing/)
风险与边界
官方定价可能随市场或政策调整,实际以 xAI 开发者控制台为准。API 调用可能受地域、配额或合规限制。以上为 GrokCode 实验室实测分析,非法律意见,仅供工程参考。请勿用于违规用途。
延伸阅读
English summary
Grok API 2026 pricing provides verifiable per-token costs across models like Grok 4.6 ($2/$0.50/$6 short context), Grok 4.3, and Grok Build 0.1. Long-context prompts (200K tokens) double all rates for the full request; prompt caching offers major savings for repeated contexts. Agentic tools add fixed fees ($5 per 1K calls for web/X/code execution). TCO comparisons show official API excels in speed and zero maintenance versus vLLM self-hosting for high-volume workloads. Pricing updated with cache optimizations and batch discounts—verify latest in xAI console. Ideal for GrokCode teams focused on API transit and local labs. Actual costs vary by workload; use official data for decisions. (Word count: ~2,450 Chinese characters)
适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。