本地部署

vLLM 本地部署生产 checklist:并发、显存、量化实测思路

vLLM 本地部署生产清单:并发、显存、量化实测思路,附 2026 主流硬件档位与 TCO 计算表

本文は SEO 深度のため主に中国語です。上記は要点のローカライズ。言語切替と深リンクで国際ナビできます。

vLLM 本地部署生产 checklist:并发、显存、量化实测思路

这是 GrokCode 核心实验室提供的最工程可核验的 vLLM 生产 checklist 指南,专为 2026 年本地部署而优化。适用于有 RTX 4090/5090、A100/H100 及以上显卡的团队或个人,目标是让 7B–72B 模型在并发 32–256 请求下稳定跑 50–2000+ tokens/s,同时控制显存占用和 TCO(总拥有成本)。决策逻辑:先测显存与量化,再压测并发,最后算电费与卡购成本,避免纯理论或云端比价。

vLLM 为什么是本地部署首选

vLLM 是 2026 年本地部署 LLM 推理的 de facto 生产标准,因为它采用 PagedAttention + continuous batching,实现真并发 KV cache 管理。相比 Ollama(单用户串行)、llama.cpp(GGUF 为主)和 SGLang(部分场景更快但生态略弱),vLLM 在 OpenAI 兼容 API 基础上,支持 FP8/AWQ/GPTQ 量化、tensor-parallel 多卡、prefix caching 和 KV cache offloading,吞吐量可达 10–50× 单用户水平。 [[1]](https://vrlatech.com/running-vllm-on-your-own-hardware-the-production-guide-for-2026/) [[2]](https://atomic.chat/blog/llm-updates/ollama-vs-vllm)

核心优势(工程可验证维度)

  • 并发处理:PagedAttention 让不同请求共享 KV cache,适合 100+ 用户聊天/推理场景。
  • 显存优化:--gpu-memory-utilization 0.85–0.95 + 量化可将 70B 模型从 140 GB(FP16)压到 40 GB 左右。
  • 监控与稳定性:内置 Prometheus 指标(vllm:num_requests_running、gpu_cache_usage_perc),生产环境易集成。
  • 与 GrokCode 联动:可直接对接 API 中转本地部署实验室,实现 xAI Grok API 中转倍率 >10×。

适用人群:需要 24/7 稳定 API 服务、预算低于云端 70% 的团队(TCO 验证后 3–6 个月回本)。纯个人实验可跳过并发压测。

硬件与显存配置实测

2026 年主流消费/服务器卡显存配置如下(数据来自 2026 年多卡实测汇总,含 KV cache + 15–20% 框架开销):

GPU 型号显存 (GB)推荐模型INT4 量化后显存 (GB)单卡吞吐 (tok/s, 32B 模型)TCO 月电费 (0.8 元/kWh, 满载)
RTX 4090/509024–327B–14B FP16 / 32B INT44–8800–1500150–250 元
A100 40/80G40–8032B–70B FP8/AWQ15–403000–8000600–1200 元
H100 80G / B20080–19270B+ FP8 / 405B INT440–8010000–20000+1500–4000 元

显存实测公式(权重 + KV cache + 开销):

  • 权重:FP16 = params_B × 2 GB;INT4 = params_B × 0.55 GB。
  • KV cache(FP8):每 1K tokens ≈ 0.1–0.3 GB(视模型而定)。
  • 示例:Qwen2.5 32B FP16 ≈ 65 GB + 2 GB/KV = 70 GB;INT4 ≈ 18 GB + 0.5 GB/KV = 19 GB。

生产配置 checklist(直接复制启动): `` python -m vllm.entrypoints.openai.api_server \ --model Qwen/Qwen2.5-32B-Instruct-AWQ \ --tensor-parallel-size 1 \ --gpu-memory-utilization 0.92 \ --max-model-len 8192 \ --max-num-seqs 128 \ --enable-prefix-caching \ --kv-cache-dtype fp8 \ --dtype float16 `` RTX 5090 单卡 32B INT4 可满载;A100/H100 多卡跑 70B+ 无压力。 [[3]](https://computingforgeeks.com/install-vllm-linux-production/) [[4]](https://convly.ai/vram-requirements-every-major-llm-2026/)

量化方案对比与推理速度

量化是显存与速度双赢的关键:FP8(H100+ 原生)质量损失 <2%,INT4 (AWQ/GPTQ) 节省 70% 显存,吞吐提升 1.2–1.5×。

2026 量化 vs 速度实测(RTX 5090 + Qwen3 14B,ShareGPT 负载)

量化方式显存占用吞吐 (tok/s)TTFT p50 (ms)质量损失推荐场景
FP1628 GB55–6845–600%最高精度,显存充足时
FP814 GB80–11040–50<2%H100+,平衡首选
AWQ INT48–9 GB65–7450–703–5%消费级显存,生产稳定
GPTQ INT48–9 GB71–8148–654–6%社区量化模型,速度稍快

AWQ/GPTQ 在 vLLM 中表现最佳(Marlin 内核加速),FP8 在 Blackwell/Hopper 上 decode 速度翻倍。实测显示,INT4 可将 32B 模型从 70 GB 压到 19 GB,同时吞吐 +30%(不影响中文/代码任务)。 [[5]](https://docs.gpustack.ai/2.0/performance-lab/references/the-impact-of-quantization-on-vllm-inference-performance/) [[6]](https://zenn.dev/toki_mwc/articles/ed9ad65bca8691)

量化 checklist

  • 优先 AWQ(质量最好)。
  • FP8 只在支持 Transformer Engine 的卡上。
  • 质量验证:用 GrokCode 模型天梯 或 OpenAI API 做 A/B 测试(同种子相同 prompt)。

并发压力测试与可用率

vLLM 在高并发下优势明显:PagedAttention 让吞吐线性扩展,而非指数衰减。

RTX 4090 + Qwen2.5 7B(FP16/AWQ)并发 sweep 测试(ShareGPT 风格,输入 2K,输出 512):

并发数吞吐 (tok/s)QPS成功率Mean TTFT (ms)P99 TTFT (ms)GPU 利用率
11780.28100%3014730%
85291.61100%52532065%
3226384.00100%6416695%
12850885.9198.5%13846399%
25614895.8291%1200320099%

峰值在 128 并发附近(高并发头尾延迟主要来自排队,非模型瓶颈)。可用率 >98% 时,建议 max-num-seqs 调至 128–256,--gpu-memory-utilization 0.90。 [[7]](https://www.truefoundry.com/blog/vllm-benchmark) [[3]](https://computingforgeeks.com/install-vllm-linux-production/)

生产 checklist

  • 目标:TTFT p95 < 500 ms,TPOT < 100 ms。
  • 监控:Prometheus + Grafana(vllm:gpu_cache_usage_perc < 85%)。
  • 故障应对:enable-chunked-prefill + prefix caching。

TCO 计算(电费 + 卡 + 维护)

2026 主流硬件 TCO 月度估算(RTX 4090 入门,H100 生产级,0.8 元/kWh,3 年折旧):

配置硬件成本 (¥)月电费 (满载)月维护 (人时)3 年 TCO (¥)每月平均备注
1× RTX 509018,000150–250200~70,0002,3007B–14B 生产
1× A100 80G80,000600–1200300~350,00011,70032B–70B
2× H100 80G500,0001,500–4,000400~2,200,00073,00070B+ 高并发

计算公式(实用版):

  • 月电费 = 功率 (W) × 24 × 30 × 0.8 / 1000
  • TCO = 硬件采购 + 电费 + 折旧(3 年) + 运维

高并发(256 req)下,单 H100 产出 18,000 tok/s,成本降至云端 1/40 以下。量化 + FP8 可再省 30–50% 电费。 [[8]](https://llmconfigurator.com/en/guides/llm-electricity-cost)

常见问题排查表

问题症状诊断修复方案 (vLLM flag)预期效果
CUDA OOM启动或请求失败gpu-memory-utilization 过高0.80–0.85 + enforce-eager显存分配正常
低可用率/排队成功率 <95%max-num-seqs 过大128–256,gpu-memory-utilization 0.90吞吐峰值
KV cache 爆炸长上下文 (32K+) OOM--max-model-len 过大8192–16384(实际场景)内存可控
首 Token 延迟高TTFT p99 > 1s无 prefix caching--enable-prefix-caching50%+ 提升
慢启动冷启动 10s+CUDA graph 占用--enforce-eager启动 <2s
监控指标异常gpu_cache_usage_perc 95%+量化/并发不匹配调回 0.85–0.90稳定运行

排查顺序:1. 日志看 CUDA 报错;2. Prometheus 检查指标;3. 逐步降低参数验证。 [[9]](https://markaicode.com/errors/vllm-not-working-fix/)

风险与边界

本 checklist 基于 2026 年公开基准测试与实验室实测,工程可复现,但实际效果取决于硬件稳定性、负载分布和模型质量。非法律意见:仅供参考,不构成任何合同、保证或投资建议。vLLM 官方版本需与 CUDA 驱动匹配;量化模型质量可能轻微下降(<5%),不适合对准确性极致要求场景。GPU 散热、电源冗余、数据备份是生产必备;超高并发(>500 req)建议多节点。

延伸阅读

English summary

This GrokCode production checklist for vLLM local deployment covers concurrency tuning, memory sizing, quantization benchmarks, and TCO calculations for 2026 hardware. vLLM is the go-to choice for reliable on-prem serving due to PagedAttention and OpenAI compatibility, delivering 10-50x better throughput than alternatives. Real-world tests on RTX 5090/A100/H100 show quantized 32B models achieving 1000+ tok/s at 128 concurrency with 90% GPU utilization. Use the provided tables for sizing (e.g., INT4 reduces 70B VRAM to ~40 GB) and the troubleshooting matrix to avoid OOM or queueing issues. TCO examples range from ¥2,300/month for a single 5090 setup to ¥73,000 for dual H100 production. Always validate with your actual workload; this is not legal advice—focus on lab-measured facts for verifiable results.

(正文字数约 2850,去除空白后中文为主)

适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。