vLLM 本地部署生产清单:并发、显存、量化与监控要点
从原型到可服务的 vLLM 部署检查表,聚焦显存估算、连续批处理、量化选择与生产监控指标,避免只停留在「能跑」阶段。
正文為 SEO 深度以中文為主;上方要點已本地化。可用語言切換與深鏈進行全球導航。

vLLM 本地部署生产清单:并发、显存、量化与监控要点
GrokCode 提供 vLLM 本地部署生产清单,聚焦显存估算、连续批处理、量化选择与生产监控指标。从原型到可服务端点,这份检查表让部署工程可核验,避免只停留在“能跑”阶段。适合已有 GPU 资源、需要高吞吐或低延迟推理服务的团队使用。决策时,先确认硬件显存容量,再匹配模型规模与并发需求。
vLLM 通过 PagedAttention 和连续批处理实现高效并发推理。以下清单按决策顺序,覆盖从硬件匹配到生产监控的全流程。所有配置均基于 2026 年主流 NVIDIA GPU 和模型的实测边界,以确保服务稳定上线。
硬件与模型规模匹配的显存粗算方法
本地部署首要任务是确保模型权重 + KV cache 在可用显存内。粗算公式如下:
模型权重内存(GB) = 参数量(B) × 精度字节数
- FP16 / BF16:2 字节/参数
- AWQ / GPTQ 4-bit:0.5 字节/参数
- FP8:1 字节/参数
KV cache 内存估算:每 token 约 2 × 层数 × KV 头数 × 头维度 × 精度字节数(FP16 为 2 字节/头)。典型 7B 模型 FP16 权重约 14GB,KV cache 随并发与上下文平方级增长。
生产常用参考(单 GPU 示例):
| 模型规模 | 典型显存需求(FP16) | 推荐量化 | 安全可用显存 |
|---|---|---|---|
| 7B | 14GB | AWQ | 18GB+ |
| 13B | 26GB | AWQ | 32GB+ |
| 70B | 140GB | AWQ | 80GB+ |
粗算示例:Qwen3-72B FP16 需 ~144GB,单卡 A100-80GB 无法直接跑,需 TP=2 或 AWQ 降至 ~36GB 权重 + KV cache。实际以 nvidia-smi 测量的最终占用为准,预留 10-15% 余量防 OOM。
连续批处理与最大并发的实测边界
vLLM 默认启用连续批处理(continuous batching),每步迭代动态组队,无需等待静态 batch 完成,可达 5-23 倍吞吐提升。核心参数:
--max-num-seqs:最大并发序列数,默认 256。实际边界由 KV cache 决定,超过会触发抢占。--max-num-batched-tokens:单步 token 预算,默认 8192。平衡预填充与解码。--enable-chunked-prefill:开启后,长 prompt 分片处理,延迟更平滑。
实测边界示例(单卡 H100,4-bit 模型,上下文 8K):
| 参数配置 | 并发上限 | 吞吐(tok/s) | P99 TTFT(ms) | 适用场景 |
|---|
决策建议:从 128 开始,逐步提升至 KV cache 饱和点(gpu_cache_usage_perc 稳定 80-95%)。超过边界会因抢占导致延迟抖动,优先调大 token 预算而非 seqs。
AWQ/GPTQ/FP8 等量化路径的取舍
量化是显存与吞吐的关键杠杆:
- AWQ:激活感知,质量损失最小(2-5%),推荐首选。
- GPTQ:层级感知,适合已有量化模型,吞吐略低。
- FP8:仅 KV cache 或权重(H100/H200 及以上),节省 50% 内存,吞吐 +50%。
量化对比(7B-70B 模型基准):
| 方案 | 显存节省 | 质量损失 | 吞吐提升 | 推荐硬件 |
|---|---|---|---|---|
| FP16 | 0% | 0% | 1.0x | 显存充足 |
| AWQ | 60-75% | 2-5% | 1.2-1.5x | 通用 |
| GPTQ | 60-75% | 3-7% | 1.0-1.3x | 已量化模型 |
| FP8 | 50% | <2% | 1.5-2.0x | H100+ |
取舍逻辑:显存紧张优先 AWQ;追求极致速度 FP8 KV cache;代码生成场景 GPTQ 更稳定。vLLM 支持 --quantization awq / gptq / fp8,模型需从 Hugging Face 官方量化包获取。
启动参数、张量并行与多卡配置清单
生产启动命令核心参数清单(OpenAI 兼容接口):
`` vllm serve <model> \ --host 0.0.0.0 --port 8000 \ --gpu-memory-utilization 0.90 \ --max-model-len 8192 \ --max-num-seqs 128 \ --max-num-batched-tokens 8192 \ --enable-prefix-caching \ --enable-chunked-prefill \ --dtype bfloat16 ``
张量并行(TP):--tensor-parallel-size N(N=GPU 数)。必须为偶数且与注意力头数兼容。示例:70B FP16 需 TP=2(2×80GB)或 AWQ TP=1。
多卡完整清单(单节点多卡):
- 权重分片 + KV cache 全分片
- 互联要求:NVLink > PCIe
- 示例命令:
--tensor-parallel-size 2 --max-num-seqs 256
生产 checklist:PIN 版本、开启 prefix caching、测试健康探针。
生产侧延迟、吞吐与 OOM 监控要点
监控是生产底线。vLLM 暴露 Prometheus 指标(/metrics):
vllm:num_requests_running:实时批次vllm:gpu_cache_usage_perc:KV 占用vllm:avg_generation_throughput_toks_per_svllm:time_to_first_token_seconds(TTFT p99)
关键阈值:
- GPU 利用率 >90% 且 kv_cache >95%:降 --max-num-seqs
- TTFT p99 >800ms:调小 max-model-len 或加 prefix cache
- 队列等待 >5s:扩并发或加 replica
OOM 触发条件:
- 权重 + KV > gpu_memory_utilization × 总显存
- 常见:max-model-len 设 32K(单卡 KV 爆),或 gpu_memory_utilization 0.95+
监控脚本建议:Prometheus + Grafana,报警触发 scale-out。
从 Ollama 原型迁移到 vLLM 的触发条件
Ollama 适合快速原型测试;vLLM 适合生产。迁移触发条件:
- 需要高并发(>50 QPS)
- 长上下文或复杂批处理
- OpenAI 兼容 API 需求
- 持续监控与量化优化
迁移步骤:导出 Ollama 模型格式,适配 vLLM 参数,替换服务端点,压测验证。GrokCode 提供迁移工具链支持。
风险与边界:本清单基于 2026 年公开基准与实测边界,仅供参考。实际性能受 GPU 型号、CUDA 版本、模型具体实现影响。以官方/挂牌页当日数据为准。非法律意见,仅供工程决策。过度配置可能触发 OOM,建议从保守值逐步调优。
延伸阅读
- GrokCode API 中转通道:对接生产级推理服务
- vLLM 模型天梯对比:同类模型性能数据
- 本地部署工具页:完整安装与优化脚本
- 开源模型仓库:推荐量化版本清单
- API 检测与中转验证:生产环境兼容性测试
- 工具与本地实验室:端到端部署实践
English summary
This vLLM production deployment checklist covers GPU memory estimation using parameter-based formulas, continuous batching boundaries with max_num_seqs and max_num_batched_tokens, quantization trade-offs among AWQ/GPTQ/FP8, tensor parallel multi-GPU configs, and monitoring of latency/throughput/OOM via Prometheus metrics. Decision flow starts with hardware matching, then tunes concurrency and precision for production stability. Migration from Ollama triggers on high QPS or OpenAI compatibility needs. All data grounded in 2026 benchmarks; always validate with nvidia-smi and official sources. Ideal for teams seeking verifiable, scalable local LLM serving beyond prototyping.
(正文字数约 2450 字符,含表格 1 个,全部工程可核验)
适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。