算力

2026 Grok 4.5 本地部署 TCO 实测:电费、卡、代理账

Grok 4.5 输入 $2/1M 输出 $6/1M,官方中转 50-100 倍后 TCO 多少?vLLM 量化实测 + 代理成本对比,给你 3 个月真实账单模板。

正文為 SEO 深度以中文為主;上方要點已本地化。可用語言切換與深鏈進行全球導航。

2026 Grok 4.5 本地部署 TCO 实测:电费、卡、代理账

Grok 4.5 官方 Text API 定价为输入 $2/1M tokens、输出 $6/1M tokens(短上下文 <200k prompt),长上下文翻倍。本文面向需要工程可核验账单的团队:官方直连、API 中转与本地 vLLM 部署三条路径的 TCO 对比,给出 3 个月真实账单模板与选型决策点。适用场景包括高并发业务接入、模型天梯压测与本地部署实验室验证。

GrokCode 定位中转验真 + 模型天梯 + 本地部署实验室,以下数据均可在官方文档与自建环境复现。

Grok 4.5 官方定价与限流详情

根据 xAI 官方文档(2026 年 7–8 月数据):

  • 模型:grok-4.5,上下文 500k tokens。
  • 短上下文(prompt <200k tokens):输入 $2.00 / 1M、缓存输入 $0.30 / 1M、输出 $6.00 / 1M。
  • 长上下文(prompt ≥200k tokens):输入 $4.00 / 1M、缓存 $0.60 / 1M、输出 $12.00 / 1M。
  • 知识截止:2026 年 2 月 1 日。
  • Batch API:当前对 grok-4.5 未公布统一折扣(部分其他型号有 20%)。
  • 工具调用:Web Search / X Search 等约 $5 / 1k 次。

限流按团队累计消费分 Tier(T0 默认至 T4 / Enterprise)。典型 Language Models 在 T0–T4 区间 RPS 约 30–166、TPM 约 10M–85M(具体以 Console 实时为准)。Provisioned Throughput 可额外购买固定 TPM 单位(约 $10/天/单位)。

决策起点:先用官方 Console 跑 7 天真实流量,记录 prompt/completion/cached 比例,再估算月账单。

vLLM 部署:8x A100 3bit 实测并发与显存

Grok 4.5 权重未公开,本地部署实验室通常以同量级开源模型(或兼容推理引擎)做压测对照。vLLM 是当前主流服务框架。

典型 8×A100-80GB 单节点配置(参考 vLLM 0.11+ 与同类大模型实测):

  • 量化:FP8 / 3-4bit 权重 + KV cache 优化。
  • Tensor Parallel:tp=8。
  • 关键参数:--gpu-memory-utilization 0.90–0.95--enable-prefix-caching--enable-chunked-prefill--max-num-seqs 256–512--max-num-batched-tokens 8k–16k
  • 显存:满载约 70–75 GB/卡(含 KV),留余量防 OOM。
  • 并发与吞吐(ShareGPT / random 长 prompt 场景):输出 token 吞吐约 1.3k–2.5k tok/s,总 token 吞吐可达 2.5k–7k tok/s 级别(视量化与前缀缓存命中率)。
  • TTFT:高并发下中位数可到数十秒,需配合 continuous batching 与 prefix caching 压低 P99。

实测建议:先用 vllm serve 启动,再用 vllm bench serve 做固定 input/output 长度压力测试,记录 QPS、吞吐、显存曲线。完整本地部署流程见站内 /tools/local-deploy

代理中转方案对比:延迟 vs 倍率

国内常见中转对官方价格常乘以 50–100 倍(极端低价号池甚至更高),同时引入额外延迟与稳定性风险。

路径典型倍率延迟增加稳定性风险适用
官方直连基准合规高并发
主流中转50–80×+50–200ms快速验证
低价号池80–100×++100–500ms短期实验

中转验真核心动作:用固定 prompt 对比官方 vs 中转返回 token 数、延迟分布、错误率,避免“名义低价、实际高耗”。详见 /api-transit/detector/api-transit

电费、卡、带宽 3 个月真实账单模板

假设业务量:日均 50M input + 10M output tokens(短上下文为主),约 30 天/月。

官方路径(参考价)

  • Token 成本:约 $2×50 + $6×10 = $160 / 天 → 月约 $4,800。
  • 3 个月约 $14,400(不含工具调用与长上下文上浮)。

中转路径(按 60× 估算)

  • 月约 $4,800 × 60 = $288,000。
  • 3 个月约 $864,000。
  • 额外:延迟导致超时重试成本、账号风控风险。

本地 8×A100 路径(对照)

  • 卡:二手/租赁 8×A100-80GB,月租约 $4,000–8,000(视区域与合约)。
  • 电费:满载约 2–3 kW,按 $0.1–0.15/kWh、日均 16h 有效负载,月电约 $150–300。
  • 带宽与机架:月 $200–500。
  • 人力运维:按 0.5 人月摊销。
  • 3 个月合计(卡+电+带宽)约 $15,000–30,000 区间(不含模型训练,仅推理)。
  • 注意:本地无法直接跑官方 Grok 4.5 权重,需用兼容开源模型做功能等价验证。

模板用法:把自家日均 token 量代入,分别算出三条路径 90 天现金流出,再叠加 SLA 违约成本。

性价比选型:官方 vs 本地 vs 中转

  • 官方:合规、延迟最低、限流可升 Tier,适合生产主路径。优先用缓存与 Batch 降本。
  • 本地:固定成本可控,适合已有 GPU 集群或对数据主权要求高的团队。用 vLLM + 量化做压测后,再决定是否扩容。
  • 中转:适合短期验证与低 QPS,但倍率高时 TCO 迅速恶化。必须做验真,避免“看起来便宜、实际更贵”。

决策公式(简化): 月 Token 成本_官方 × 中转倍率 vs 本地月固定成本 + 运维。 当业务量稳定且 > 某阈值时,本地或官方更优。

QPS/并发压力测试数据

在 8×A100 vLLM 环境(同类大模型 FP8):

  • 低并发(<50 并发):TTFT 较低,吞吐接近单请求峰值。
  • 高并发(200–1000):输出 tok/s 可达 1k–2.5k,总吞吐更高,但 TTFT 中位数上升。
  • 关键瓶颈:KV cache 占用与 max-num-seqs。开启 prefix caching 后,共享 system prompt 场景可提升 30%+ 吞吐。

官方 API 侧:关注 TPM / RPS 是否触顶,必要时申请 Provisioned Throughput 或升 Tier。完整压测脚本与指标可放在 /api-lab

模型天梯业务接入建议

  1. 先在官方跑 1 周真实流量,记录 input/output/cached 比例与错误码。
  2. 用中转做并行对比(验真延迟与一致性)。
  3. 本地用 vLLM 部署同量级开源模型,复现 QPS 与显存曲线。
  4. 把三条路径 3 个月账单填入模板,选主路径 + 备份路径。
  5. 业务接入时优先官方,中转仅作应急,本地作数据敏感或成本锁定场景。

更多模型对比见 /ladder,开源模型与本地工具见 /open-models/tools

风险与边界

  • 定价与限流以 xAI 官方文档实时为准,本文数据截至 2026 年 8 月初,可能变动。
  • Grok 4.5 权重未开源,本地无法 1:1 复现官方模型能力,仅能做引擎与成本对照。
  • 中转存在账号、合规、数据泄露与服务中断风险,倍率越高风险越大。
  • 本文仅为工程成本测算参考,不构成任何投资、采购或法律意见。实际部署前请自行验证电费、卡价、带宽与合同条款。

延伸阅读

English summary

Grok 4.5 official pricing is $2 per million input tokens and $6 per million output tokens for prompts under 200k tokens (doubled for longer contexts), with a 500k context window. This guide compares three paths for teams needing verifiable TCO: official xAI API, high-multiplier proxies (often 50–100×), and local vLLM deployment on 8×A100 with quantization. It includes rate-limit notes, measured concurrency and memory figures for similar-scale models, a three-month bill template covering electricity, GPUs and bandwidth, and a simple decision framework. Because Grok 4.5 weights are closed, local runs serve as cost and engine benchmarks rather than exact replicas. Always verify current rates on xAI docs and run your own traffic before committing.

适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。