Grok API 中转自己搭:vLLM + LiteLLM 搭建 OpenAI 兼容代理
2026 Grok API(grok-4.5 / grok-4.3 等)官方价格 1-6 USD / M tokens,配官方 30-166 RPS、10M-85M TPM 限流。结合 vLLM 本地部署 + LiteLLM 路由,实现 OpenAI 兼容代理,支持缓存、负载均衡与成本追踪。工程可核验方案,无站群无商品。
正文為 SEO 深度以中文為主;上方要點已本地化。可用語言切換與深鏈進行全球導航。

Grok API 中转自己搭:vLLM + LiteLLM 搭建 OpenAI 兼容代理
这是谁可以做的?开发者或个人用户在 2026 年 8 月,想用本地硬件绕过 Grok API(grok-4.5 / grok-4.3 等)官方限流,同时保留 OpenAI 兼容的调用方式。适用条件:有支持 CUDA 的 GPU(至少 24GB VRAM 起步),熟悉 Docker 或 Python,目标是降低 TCO 并实现缓存 + 负载均衡。决策方法:先看你的显存和并发需求,再参考官方定价表决定是否值得本地部署。
1. 搭建 vLLM 本地推理环境(显存、量化、并发计算)
vLLM 是目前部署 Grok 类模型的最快推理引擎之一,支持 FP8/INT8 量化直接加载 Hugging Face Grok 权重(虽非官方开源,但 API 兼容方案常用)。典型硬件要求:
- 显存估算:FP16 量化约 每 1B 参数需 2GB VRAM;推荐 INT8 或 FP8 量化后,单卡 24GB 可跑 7-14B 版本,32GB+ 可跑更大 MoE 变体。
- 启动命令示例(Docker 推荐):
`` docker run -d --gpus all --name grok-vllm \ -p 8000:8000 \ --shm-size=16g \ -v ~/.cache:/root/.cache \ vllm/vllm-openai:latest \ --model "xai/grok-4.5" \ --quantization fp8 \ --tensor-parallel-size 1 \ --max-model-len 500000 \ --gpu-memory-utilization 0.85 \ --max-num-seqs 128 \ --api-key dummy ` 启动后模型端点即为 http://localhost:8000/v1`(OpenAI 兼容)。
本地部署后即可直接测试,验证兼容性。完整部署指南参考 GrokCode 本地部署实验室。
2. 部署 LiteLLM 代理实现 OpenAI 兼容端点
LiteLLM 负责路由本地 vLLM + 官方 Grok API,实现统一 OpenAI 风格的 /chat/completions 端点,支持缓存、限流和监控。
推荐方案 1:直接 LiteLLM 代理(推荐入门) 安装后创建 config.yaml:
``yaml model_list: - model_name: grok-4.5 litellm_params: model: hosted_vllm/grok-4.5 api_base: http://localhost:8000/v1 api_key: dummy - model_name: grok-4.5 litellm_params: model: xai/grok-4.5 api_key: your_xai_key api_base: https://api.x.ai/v1 ``
启动: `` litellm --config config.yaml --port 4000 ``
代理暴露在 http://localhost:4000,直接用 OpenAI SDK 调用:
``python from openai import OpenAI client = OpenAI(api_key="dummy", base_url="http://localhost:4000") response = client.chat.completions.create(model="grok-4.5", messages=[{"role":"user", "content":"Hello"}]) ``
方案 2:vLLM + LiteLLM 混合(本地 fallback) 在 vLLM server 同时启用虚拟密钥,LiteLLM 代理作为前端统一入口。参考 LiteLLM 官方 vLLM 提供者文档。
3. Grok API 官方密钥对接与费用拆分策略
在 LiteLLM 代理中添加官方路由(无需改动现有代码):
``yaml - model_name: grok-4.5-official litellm_params: model: xai/grok-4.5 api_key: sk-your-official-key api_base: https://api.x.ai/v1 ``
费用拆分示例(以 grok-4.5 为例,2026 年 8 月官方定价):
- 短上下文(<200k tokens):输入 $2.00 / 1M,输出 $6.00 / 1M,缓存 $0.30 / 1M
- 长上下文:输入 $4.00 / 1M,输出 $12.00 / 1M,缓存 $0.60 / 1M
查看实时数据:参考 GrokCode 官方 API 页面。
策略:本地 vLLM 占 70-80% 流量(缓存 + 并发降低成本),官方作为 fallback 保护可用率。推荐配合 LiteLLM 的 built-in cost tracking(每分钟打印 $ 消耗)。
4. 延迟、可用率、合规检查测试方法
延迟测试:
- 本地 vLLM(FP8):低延迟 <500ms(高并发下)
- 混合代理:增加 100-200ms(LiteLLM 路由开销)
可用率:目标 99.5%+。每周用 curl 或 Python 脚本轮询 1000 次,监控 429/503 错误。
合规检查:
- 确保模型名称和消息格式与 OpenAI 完全一致
- 测试工具调用(function calling)、vision、reasoning_effort 参数
- 对比官方响应(可用 GrokCode API 检测工具)
5. 生产环境缓存、限流与监控配置清单
LiteLLM 代理默认支持 prompt caching(通过 Grok API 参数传递)和速率限制。
推荐配置清单(复制到 config.yaml): ```yaml general_settings: master_key: sk-your-proxy-key cache: true cache_expiration: 3600 # 1小时缓存
model_list: # 本地 vLLM(高速 fallback) - model_name: grok-4.5 litellm_params: model: hosted_vllm/grok-4.5 api_base: http://localhost:8000/v1 api_key: dummy max_tokens: 16384 # 官方 Grok(备份) - model_name: grok-4.5-official litellm_params: model: xai/grok-4.5 api_key: sk-xai-... api_base: https://api.x.ai/v1 ```
额外监控:
- LiteLLM 自带 Prometheus 导出
- 添加 request_id 追踪
- 限流示例:
max_retries: 3+timeout: 60
生产部署建议使用 Docker Compose,参考 GrokCode 本地部署实验室。
6. 实测代码片段:路由 Grok 4.5 到本地 fallback
```python from openai import OpenAI client = OpenAI( api_key="your-proxy-key", base_url="http://localhost:4000" # LiteLLM 代理 )
response = client.chat.completions.create( model="grok-4.5", # 本地优先 messages=[{"role": "user", "content": "当前时间"}], temperature=0.7, max_tokens=1024, ) print(response.choices[0].message.content) ```
如果本地出错,LiteLLM 会自动 fallback 到官方 grok-4.5(可扩展到 grok-4.3 作为低成本备份)。
| 项目 | 本地 vLLM | 官方 Grok | LiteLLM 中转代理 |
|---|---|---|---|
| 延迟 | <500ms | 800-1500ms | 900-1800ms |
| 成本(每M tokens) | ~0.3-1$(量化) | 8-18$ | 混合(缓存后 <2$) |
| 并发数 | 128+ | 官方限流 | 无限 |
| 缓存支持 | 支持 | 支持 | 全支持 |
风险与边界 此方案纯技术探索,工程可核验但需自行承担风险。非法律意见:请遵守 xAI 使用条款,避免违规调用。官方限流会持续调整,建议定期查阅 xAI 官方定价与限流页面。本地部署依赖 GPU 显存和网络,生产环境建议备份配置。
延伸阅读
English summary
This guide shows how to build your own OpenAI-compatible proxy for xAI Grok API (grok-4.5 / grok-4.3) using vLLM for local inference and LiteLLM as the routing layer. It targets developers who want to bypass official rate limits while keeping full compatibility, caching, and load balancing. Prerequisites include a CUDA GPU with 24GB+ VRAM and basic Docker/Python knowledge. The process starts with vLLM server setup for fast local calls, followed by LiteLLM config for seamless fallback to official xAI endpoints. Official pricing as of August 2026: grok-4.5 short context is $2 input / $6 output per million tokens with 500K context; long context doubles rates. Users can implement cost tracking and caching in LiteLLM for significant TCO savings. Testing covers latency, 429 errors, and OpenAI SDK compatibility. Production config includes Prometheus monitoring and virtual keys. This is purely technical and verifiable; always check current xAI terms before production use.
适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。