vLLM 本地部署生产清单:并发、显存、量化实测思路
GrokCode 实验室 vLLM 本地部署生产级 checklist:结合模型天梯需求,实测 70B/13B 模型在 RTX 4090/ A6000 上的并发数、显存占用与量化方案。专为 Grok API 中转与 xAI 中转提供可立即运行的部署方案。
本文は SEO 深度のため主に中国語です。上記は要点のローカライズ。言語切替と深リンクで国際ナビできます。

vLLM 本地部署生产清单:并发、显存、量化实测思路
GrokCode 实验室把 vLLM 本地部署当作模型天梯与 API 中转的核心基础设施。本文给出面向生产的 checklist:在 RTX 4090 / A6000 上跑 13B / 70B 量级模型时,如何核对硬件、选择量化、压测并发、控制显存,并直接服务 Grok API 中转与 xAI 中转场景。适合已有单卡或多卡环境、需要可复现吞吐与稳定性的工程团队,决策依据是实测显存占用、并发上限与中转倍率成本,而非厂商宣传参数。
1. 硬件配置核对(显存、显卡规格)
生产部署前先做硬件基线核对,避免“能启动但跑不起来”的假阳性。
- 显存红线:13B 级别(FP16)通常需要约 26–30 GB;70B 级别(FP16)需要约 140 GB 量级。单卡 24 GB(RTX 4090)必须依赖量化;48 GB(A6000)可尝试 13B 非量化或 70B 强量化。
- 规格核对清单:
- CUDA 版本 ≥ 12.1(建议与 vLLM 官方 wheel 匹配) - 驱动版本足够新,支持目标 GPU 的计算能力 - PCIe 带宽与多卡互联(NVLink / 无 NVLink 时的跨卡通信开销) - 系统内存 ≥ 显存 × 1.5,避免 CPU offload 成为瓶颈
- GrokCode 实践建议:把硬件信息记入模型天梯条目,后续压测结果可直接挂到 /ladder 与 /tools/local-deploy 对应条目,方便中转倍率核算。
2. vLLM 基础安装与启动命令
优先使用官方推荐的 pip / uv 安装方式,锁定版本以便复现。
```bash
示例:创建隔离环境后安装(具体版本以官方文档为准)
pip install vllm ```
最小可运行启动示例(单卡、AWQ 量化、开启 prefix caching):
``bash python -m vllm.entrypoints.openai.api_server \ --model /path/to/model \ --quantization awq \ --max-model-len 8192 \ --gpu-memory-utilization 0.90 \ --enable-prefix-caching \ --port 8000 ``
关键参数说明:
--gpu-memory-utilization:控制预留比例,生产环境建议 0.85–0.92,留足 KV cache 与突发空间。--max-model-len:直接决定上下文与并发上限,过大会挤占 KV cache。- OpenAI 兼容接口便于对接现有 Grok API 中转与 xAI 中转代理层。
安装后立刻用简单 curl 验证健康检查与一次 completion,确认 tokenizer、权重加载与 CUDA 无报错。
3. 量化方法对比(4bit vs 8bit)
量化是 24 GB 卡跑大模型的刚需。下表给出常见路径的实测取向(数值为量级参考,实际以本机 log 为准):
| 量化方案 | 典型显存占用(13B) | 精度损失感知 | 并发友好度 | 适用场景 |
|---|---|---|---|---|
| FP16/BF16 | 26–30 GB | 最低 | 低 | A6000 及以上 |
| 8bit (GPTQ/AWQ) | 14–18 GB | 较低 | 中 | 单卡 24 GB 稳妥 |
| 4bit (AWQ/GPTQ) | 8–12 GB | 中等 | 高 | 高并发 / 更长上下文 |
实测思路:
- 同一模型、同一 prompt 集,分别加载 FP16 / 8bit / 4bit。
- 记录
nvidia-smi峰值显存、首次 token 延迟、持续吞吐。 - 用业务侧真实对话长度(而非合成短 prompt)评估质量下降是否可接受。
- 结果写入本地实验记录,并与模型天梯条目交叉验证。
GrokCode 实验室更倾向 AWQ/GPTQ 的 4bit 方案做高并发中转,8bit 作为质量敏感路径的备选。
4. 并发压力测试标准
并发是生产可用性的核心指标。建议固定以下测试协议:
- 工具:vLLM 自带 benchmark 或 locust / 自定义 asyncio 客户端。
- 负载设计:固定 input/output token 长度分布(例如 512 in / 256 out),逐步提升并发数(1 → 4 → 8 → 16 → 32)。
- 观察指标:
- 成功率(非 5xx / timeout) - P50 / P99 延迟 - 每秒生成 token 数 - 显存与 GPU 利用率曲线
- 判定标准:在目标 P99 延迟内,找到最大稳定并发;再留 20–30% 余量作为生产上限。
把压测脚本与结果日志纳入版本管理,后续模型或量化变更时可快速回归。相关实践可对照 /api-lab 与 /tools 中的本地部署工具集。
5. 中转倍率优化实践
本地部署的最终目标之一是支撑稳定、可核算的 API 中转。
- 根据实测吞吐与电费 / 硬件折旧,计算单位 token 成本,再映射到中转倍率。
- 优先开启 prefix caching 与 continuous batching,降低重复前缀的计算开销。
- 对高频短请求与长上下文请求分队列或分实例,避免长请求拖垮整体并发。
- 将本地实例的健康状态与限流策略接入现有中转检测链路,详见 /api-transit 与 /api-transit/detector。
这样可以把“能跑”升级为“能按倍率稳定卖服务”,并与官方 API 路径形成互补(参考 /official-api)。
6. 监控与日志配置
生产环境必须可观测:
- GPU 侧:持续采集
nvidia-smi或 DCGM 指标(利用率、显存、温度、功耗)。 - vLLM 侧:开启请求级日志与 metrics endpoint,记录 queue time、generation time、token 统计。
- 告警阈值:显存 > 95%、持续高温、P99 延迟飙升、错误率 > 1%。
- 日志保留:至少保留完整请求 ID 与关键参数,便于事后与中转侧对账。
监控数据可回流到模型天梯,形成“硬件 → 量化 → 并发 → 成本”的闭环。
7. 常见问题排查
- OOM:降低
--gpu-memory-utilization或--max-model-len;检查是否有残留进程;确认量化真正生效。 - 启动慢 / 加载失败:检查磁盘 IO、权重格式、CUDA 与驱动匹配。
- 吞吐远低于预期:关闭不必要的采样参数、确认 continuous batching 生效、检查是否被 CPU tokenizer 或网络拖累。
- 质量异常:对比量化前后同一 prompt 输出;必要时回退到更高精度量化。
- 多卡异常:优先验证单卡稳定,再逐步增加 tensor parallel size。
排查时把完整命令行、环境变量与 nvidia-smi 输出一并记录,便于复现与社区对照。
风险与边界
本地部署涉及硬件采购、电力、散热与模型权重合规使用。本文仅提供工程实测思路与 checklist,不构成任何法律、合规或商业承诺。实际生产前请自行验证许可证、出口管制与数据安全要求。量化与并发数字会随模型版本、驱动、vLLM 版本变化,必须以本机实测为准。GrokCode 不提供绕过官方计费、盗用密钥或任何违法用途的指导。
延伸阅读
English summary
This GrokCode laboratory guide provides a production checklist for deploying vLLM locally, focused on concurrency, VRAM usage, and quantization for 13B/70B-class models on RTX 4090 and A6000 GPUs. It covers hardware verification, installation and startup commands, 4-bit versus 8-bit quantization trade-offs, standardized load-testing protocols, practical tips for optimizing API transit multipliers, monitoring setup, and common troubleshooting steps. The content is engineered for reproducible results that support Grok API and xAI transit scenarios, linking hardware measurements directly to model ladder entries and cost calculations. All numerical guidance is approximate and must be validated on the target machine; the article does not constitute legal or compliance advice.
适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。