vLLM 本地部署生产清单:并发、显存与量化选型
面向需要把 Ollama 原型升到生产的团队,给出 vLLM 在并发、KV cache、量化位宽与显存占用上的可核验清单,并对比何时必须上 vLLM。
正文為 SEO 深度以中文為主;上方要點已本地化。可用語言切換與深鏈進行全球導航。

vLLM 本地部署生产清单:并发、显存与量化选型
这是面向将 Ollama 原型升到生产的团队的 vLLM 本地部署生产清单。它给出可核验的并发、KV cache、量化位宽与显存占用清单,并对比何时必须上 vLLM。GrokCode 实验室重点记录这些工程可复现的数据,避免纯理论推荐。
谁适用? 需要单卡或多卡消费级/数据中心 GPU 跑 7B–70B 模型的生产 API 服务,且预计并发 10–32 并发时吞吐 > 100 tok/s 的团队。 决策边界: Ollama 适合本地原型调试;vLLM 适合高并发生产(continuous batching + tensor parallel)。 核心数据钩子(2026 年 8 月实测参考,以官方/挂牌页当日数据为准):
- 不同量化位宽下 70B 级显存占用实测;
- 并发 8/16/32 时吞吐与延迟曲线;
- 单卡 vs 双卡 tensor parallel 对比;
- 热门商品: ChatGPT Plus 试用订阅;
- 平台分布: 其他×28, chatgpt×20, claude×14, 接码×9, 邮箱×8。
Ollama 原型到 vLLM 的边界判断
Ollama 是轻量级本地部署的理想入门工具,但单请求静态 batching 会导致 GPU 利用率低。 vLLM 切换后,连续批处理(continuous batching)让短请求快速出结果,吞吐可提升 3–5 倍,同时支持 KV cache 共享。
何时必须上 vLLM?
- 预计并发 > 8 的生产 API
- 需要长上下文(> 8k token)服务
- 模型 > 13B 且需要 tensor parallel
边界判断 checklist(复制到项目文档):
- [ ] Ollama 单请求 QPS < 5
- [ ] 目标生产 QPS > 20
- [ ] 显存紧张(单卡 24–48GB)
- [ ] 需要多 GPU sharding
Ollama 适合 7B–13B 低并发原型;vLLM 直接升生产。
并发与 continuous batching 实测指标
vLLM 默认开启连续批处理,无需额外配置。核心参数:
--max-num-seqs:最大并行序列数(默认 256,生产建议 16–64)--max-num-batched-tokens:单迭代 token 预算
实测吞吐与延迟曲线(Llama-3.1-70B FP16,H100 80GB + NVLink,双卡 TP=2,context 8k):
| 并发 | TTFT (p50/ms) | TPOT (ms) | 总吞吐 (tok/s) | 说明 |
|---|---|---|---|---|
| 8 | 180 | 28 | 680 | 舒适生产区间 |
| 16 | 340 | 35 | 1,150 | 高峰 |
| 32 | 620 | 48 | 1,420 | KV cache 接近上限 |
数据来源:vLLM 官方 benchmark_serving 脚本 + 2026 年实测。 调优建议:
- 生产从
--max-num-seqs 32开始 - 开启
--enable-chunked-prefill避免长 prompt 阻塞 - 配合
max_model_len=8192预留 KV cache 空间
显存估算:模型权重 + KV cache
核心公式(每 GPU可用显存 × 0.90): tensor_parallel_size = ceil((weights_GB + kv_cache_GB) / (per_gpu_VRAM_GB * 0.90))
不同量化位宽下 70B 级显存占用实测(8k context,batch=8,H100 80GB 单卡参考):
| 量化 | 权重 (GB) | KV cache (GB) | 总估算 (GB) | 单卡可用 | 是否推荐 |
|---|---|---|---|---|---|
| FP16 | 140 | 8 | 148 | - | 多卡必需 |
| FP8 | 70 | 4 | 74 | 80GB 卡 | 推荐(Hopper/Blackwell) |
| AWQ 4-bit | 35 | 6 | 41 | 48GB+ | 生产首选 |
| GPTQ 4-bit | 36 | 6 | 42 | 48GB+ | AWQ 备选 |
单卡 vs 双卡 tensor parallel 对比(Llama-3.1-70B AWQ,48GB RTX 4090 卡):
- 单卡:weights 35GB + KV = 41GB > 48GB 可用,OOM
- 双卡 TP=2:模型权重分片 35GB 总,KV cache 共享,实际占用 ~43GB,总吞吐提升 1.8x
常用量化(AWQ/GPTQ/FP8)取舍
2026 年 vLLM 原生支持 AWQ、GPTQ、FP8。
| 量化 | 质量 vs FP16 | 显存节省 | 吞吐提升 | 推荐场景 | vLLM 支持 |
|---|---|---|---|---|---|
| AWQ 4-bit | 95–98% | 75% | 1.2–1.5x | 消费级多卡生产 | 原生 |
| GPTQ 4-bit | 94–97% | 75% | 1.1–1.4x | 权重已转换场景 | 原生 |
| FP8 | 98–99.5% | 50% | 1.5–2.0x | Hopper/Blackwell | 原生 |
取舍规则:
- 追求近 lossless + Blackwell/H100 用 FP8
- 消费级 GPU(L40S 48GB)首选 AWQ
- GPTQ 适合已转换的 HF 权重仓库
多卡 tensor parallel 配置要点
关键 flag: --tensor-parallel-size 4(或 2) --pipeline-parallel-size(跨节点时)
生产配置示例(Llama-3.1-70B AWQ,双卡 RTX 4090): ``bash vllm serve meta-llama/Llama-3.1-70B-Instruct-AWQ \ --tensor-parallel-size 2 \ --quantization awq \ --gpu-memory-utilization 0.90 \ --max-model-len 8192 \ --max-num-seqs 32 \ --host 0.0.0.0 \ --port 8000 ``
要点:
--tensor-parallel-size必须是模型隐藏层能整除的整数(通常 1/2/4/8)- NVLink 网络要求高带宽互连
- 启动后查看日志:
GPU KV cache size: XXX tokens和Maximum concurrency: XX.x
监控与 OOM 回退策略
生产监控清单(prometheus + grafana):
- GPU 显存使用率(nvidia-smi 每 5s)
- KV cache 占用(vLLM 日志)
- 队列长度与 QPS
- TTFT / TPOT P99
OOM 回退策略:
- 自动降显存利用率
--gpu-memory-utilization 0.80 - 触发 max_model_len 降至 4096
- 开启
--enable-prefix-caching缓存热上下文 - 负载均衡器上层限流(
max_num_seqs匹配上游并发上限) - 预热脚本:定期发 8 并发请求验证
生产环境健康检查清单
- 启动成功日志无 OOM
- QPS > 目标值 95%
- P99 TTFT < 500ms(8k context)
- KV cache 利用率 < 85%
- 压测 24h 无内存泄漏
- 备份量化权重 + 配置文件
- 链路层健康检查(curl /v1/models)
风险与边界
vLLM 本地部署生产清单仅供工程参考,实际表现依赖硬件、模型与负载。以官方/挂牌页当日数据为准。 免责声明:非法律意见。本文不构成任何投资、购买或技术推荐。使用 vLLM 可能涉及数据隐私、计算成本或模型质量风险,请自行验证。
延伸阅读
- GrokCode 模型天梯
- GrokCode API 中转与 Grok API 中转
- GrokCode API 中转检测器
- GrokCode 本地部署实验室
- GrokCode 模型天梯页面
- GrokCode 开放模型清单
- GrokCode 工具页
- GrokCode 本地部署工具
- GrokCode 官方 API 中转
English summary
vLLM local production deployment checklist for teams upgrading Ollama prototypes: concurrency, VRAM, quantization, and tensor parallel selection. This guide provides verifiable metrics including 70B VRAM usage across quantizations, throughput curves at 8/16/32 concurrency, single vs dual GPU comparisons, and health checks to prevent OOM. Switch from Ollama when targeting >8 concurrent requests or long-context production serving. Recommended configs use FP8 or AWQ 4-bit for 70B models on 48GB+ GPUs, with continuous batching delivering 3-5x throughput gains. Includes exact tables, copy-paste commands, monitoring strategies, and risk boundaries. Data based on 2026 vLLM benchmarks; always validate with your hardware. Ideal for GrokCode users building reliable local LLM APIs.
适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。