本地部署

vLLM 本地部署生产 checklist:并发、显存、量化实测思路

vLLM 本地部署生产清单:并发、显存、量化实测思路,附 2026 主流硬件档位与 TCO 计算表

正文為 SEO 深度以中文為主;上方要點已本地化。可用語言切換與深鏈進行全球導航。

vLLM 本地部署生产 checklist:并发、显存、量化实测思路\n\n这是 GrokCode 核心实验室提供的最工程可核验的 vLLM 生产 checklist 指南,专为 2026 年本地部署而优化。适用于有 RTX 4090/5090、A100/H100 及以上显卡的团队或个人,目标是让 7B–72B 模型在并发 32–256 请求下稳定跑 50–2000+ tokens/s,同时控制显存占用和 TCO(总拥有成本)。决策逻辑:先测显存与量化,再压测并发,最后算电费与卡购成本,避免纯理论或云端比价。\n\n## vLLM 为什么是本地部署首选\n\nvLLM 是 2026 年本地部署 LLM 推理的 de facto 生产标准,因为它采用 PagedAttention + continuous batching,实现真并发 KV cache 管理。相比 Ollama(单用户串行)、llama.cpp(GGUF 为主)和 SGLang(部分场景更快但生态略弱),vLLM 在 OpenAI 兼容 API 基础上,支持 FP8/AWQ/GPTQ 量化、tensor-parallel 多卡、prefix caching 和 KV cache offloading,吞吐量可达 10–50× 单用户水平。 [[1]](https://vrlatech.com/running-vllm-on-your-own-hardware-the-production-guide-for-2026/) [[2]](https://atomic.chat/blog/llm-updates/ollama-vs-vllm)\n\n核心优势(工程可验证维度):\n- 并发处理:PagedAttention 让不同请求共享 KV cache,适合 100+ 用户聊天/推理场景。\n- 显存优化:--gpu-memory-utilization 0.85–0.95 + 量化可将 70B 模型从 140 GB(FP16)压到 40 GB 左右。\n- 监控与稳定性:内置 Prometheus 指标(vllm:num_requests_running、gpu_cache_usage_perc),生产环境易集成。\n- 与 GrokCode 联动:可直接对接 API 中转本地部署实验室,实现 xAI Grok API 中转倍率 >10×。\n\n适用人群:需要 24/7 稳定 API 服务、预算低于云端 70% 的团队(TCO 验证后 3–6 个月回本)。纯个人实验可跳过并发压测。\n\n## 硬件与显存配置实测\n\n2026 年主流消费/服务器卡显存配置如下(数据来自 2026 年多卡实测汇总,含 KV cache + 15–20% 框架开销):\n\n| GPU 型号 | 显存 (GB) | 推荐模型 | INT4 量化后显存 (GB) | 单卡吞吐 (tok/s, 32B 模型) | TCO 月电费 (0.8 元/kWh, 满载) |\n|-------------------|-----------|---------------------------|----------------------|-----------------------------|-------------------------------|\n| RTX 4090/5090 | 24–32 | 7B–14B FP16 / 32B INT4 | 4–8 | 800–1500 | 150–250 元 |\n| A100 40/80G | 40–80 | 32B–70B FP8/AWQ | 15–40 | 3000–8000 | 600–1200 元 |\n| H100 80G / B200 | 80–192 | 70B+ FP8 / 405B INT4 | 40–80 | 10000–20000+ | 1500–4000 元 |\n\n显存实测公式(权重 + KV cache + 开销):\n- 权重:FP16 = params_B × 2 GB;INT4 = params_B × 0.55 GB。\n- KV cache(FP8):每 1K tokens ≈ 0.1–0.3 GB(视模型而定)。\n- 示例:Qwen2.5 32B FP16 ≈ 65 GB + 2 GB/KV = 70 GB;INT4 ≈ 18 GB + 0.5 GB/KV = 19 GB。\n\n生产配置 checklist(直接复制启动):\n``\npython -m vllm.entrypoints.openai.api_server \\\n --model Qwen/Qwen2.5-32B-Instruct-AWQ \\\n --tensor-parallel-size 1 \\\n --gpu-memory-utilization 0.92 \\\n --max-model-len 8192 \\\n --max-num-seqs 128 \\\n --enable-prefix-caching \\\n --kv-cache-dtype fp8 \\\n --dtype float16\n``\nRTX 5090 单卡 32B INT4 可满载;A100/H100 多卡跑 70B+ 无压力。 [[3]](https://computingforgeeks.com/install-vllm-linux-production/) [[4]](https://convly.ai/vram-requirements-every-major-llm-2026/)\n\n## 量化方案对比与推理速度\n\n量化是显存与速度双赢的关键:FP8(H100+ 原生)质量损失 <2%,INT4 (AWQ/GPTQ) 节省 70% 显存,吞吐提升 1.2–1.5×。\n\n2026 量化 vs 速度实测(RTX 5090 + Qwen3 14B,ShareGPT 负载):\n\n| 量化方式 | 显存占用 | 吞吐 (tok/s) | TTFT p50 (ms) | 质量损失 | 推荐场景 |\n|--------------|----------|--------------|---------------|----------|---------------------------|\n| FP16 | 28 GB | 55–68 | 45–60 | 0% | 最高精度,显存充足时 |\n| FP8 | 14 GB | 80–110 | 40–50 | <2% | H100+,平衡首选 |\n| AWQ INT4 | 8–9 GB | 65–74 | 50–70 | 3–5% | 消费级显存,生产稳定 |\n| GPTQ INT4 | 8–9 GB | 71–81 | 48–65 | 4–6% | 社区量化模型,速度稍快 |\n\nAWQ/GPTQ 在 vLLM 中表现最佳(Marlin 内核加速),FP8 在 Blackwell/Hopper 上 decode 速度翻倍。实测显示,INT4 可将 32B 模型从 70 GB 压到 19 GB,同时吞吐 +30%(不影响中文/代码任务)。 [[5]](https://docs.gpustack.ai/2.0/performance-lab/references/the-impact-of-quantization-on-vllm-inference-performance/) [[6]](https://zenn.dev/toki_mwc/articles/ed9ad65bca8691)\n\n量化 checklist:\n- 优先 AWQ(质量最好)。\n- FP8 只在支持 Transformer Engine 的卡上。\n- 质量验证:用 GrokCode 模型天梯 或 OpenAI API 做 A/B 测试(同种子相同 prompt)。\n\n## 并发压力测试与可用率\n\nvLLM 在高并发下优势明显:PagedAttention 让吞吐线性扩展,而非指数衰减。\n\nRTX 4090 + Qwen2.5 7B(FP16/AWQ)并发 sweep 测试(ShareGPT 风格,输入 2K,输出 512):\n\n| 并发数 | 吞吐 (tok/s) | QPS | 成功率 | Mean TTFT (ms) | P99 TTFT (ms) | GPU 利用率 |\n|--------|--------------|-------|--------|----------------|---------------|------------|\n| 1 | 178 | 0.28 | 100% | 30 | 147 | 30% |\n| 8 | 529 | 1.61 | 100% | 52 | 5320 | 65% |\n| 32 | 2638 | 4.00 | 100% | 64 | 166 | 95% |\n| 128 | 5088 | 5.91 | 98.5% | 138 | 463 | 99% |\n| 256 | 1489 | 5.82 | 91% | 1200 | 3200 | 99% |\n\n峰值在 128 并发附近(高并发头尾延迟主要来自排队,非模型瓶颈)。可用率 >98% 时,建议 max-num-seqs 调至 128–256,--gpu-memory-utilization 0.90。 [[7]](https://www.truefoundry.com/blog/vllm-benchmark) [[3]](https://computingforgeeks.com/install-vllm-linux-production/)\n\n生产 checklist:\n- 目标:TTFT p95 < 500 ms,TPOT < 100 ms。\n- 监控:Prometheus + Grafana(vllm:gpu_cache_usage_perc < 85%)。\n- 故障应对:enable-chunked-prefill + prefix caching。\n\n## TCO 计算(电费 + 卡 + 维护)\n\n2026 主流硬件 TCO 月度估算(RTX 4090 入门,H100 生产级,0.8 元/kWh,3 年折旧):\n\n| 配置 | 硬件成本 (¥) | 月电费 (满载) | 月维护 (人时) | 3 年 TCO (¥) | 每月平均 | 备注 |\n|--------------------|--------------|---------------|---------------|--------------|----------|-----------------------|\n| 1× RTX 5090 | 18,000 | 150–250 | 200 | ~70,000 | 2,300 | 7B–14B 生产 |\n| 1× A100 80G | 80,000 | 600–1200 | 300 | ~350,000 | 11,700 | 32B–70B |\n| 2× H100 80G | 500,000 | 1,500–4,000 | 400 | ~2,200,000 | 73,000 | 70B+ 高并发 |\n\n计算公式(实用版):\n- 月电费 = 功率 (W) × 24 × 30 × 0.8 / 1000\n- TCO = 硬件采购 + 电费 + 折旧(3 年) + 运维\n\n高并发(256 req)下,单 H100 产出 18,000 tok/s,成本降至云端 1/40 以下。量化 + FP8 可再省 30–50% 电费。 [[8]](https://llmconfigurator.com/en/guides/llm-electricity-cost)\n\n## 常见问题排查表\n\n| 问题 | 症状 | 诊断 | 修复方案 (vLLM flag) | 预期效果 |\n|-----------------------|-----------------------|-----------------------|---------------------------------------|----------|\n| CUDA OOM | 启动或请求失败 | gpu-memory-utilization 过高 | 0.80–0.85 + enforce-eager | 显存分配正常 |\n| 低可用率/排队 | 成功率 <95% | max-num-seqs 过大 | 128–256,gpu-memory-utilization 0.90 | 吞吐峰值 |\n| KV cache 爆炸 | 长上下文 (32K+) OOM | --max-model-len 过大 | 8192–16384(实际场景) | 内存可控 |\n| 首 Token 延迟高 | TTFT p99 > 1s | 无 prefix caching | --enable-prefix-caching | 50%+ 提升 |\n| 慢启动 | 冷启动 10s+ | CUDA graph 占用 | --enforce-eager | 启动 <2s |\n| 监控指标异常 | gpu_cache_usage_perc 95%+ | 量化/并发不匹配 | 调回 0.85–0.90 | 稳定运行 |\n\n排查顺序:1. 日志看 CUDA 报错;2. Prometheus 检查指标;3. 逐步降低参数验证。 [[9]](https://markaicode.com/errors/vllm-not-working-fix/)\n\n## 风险与边界\n\n本 checklist 基于 2026 年公开基准测试与实验室实测,工程可复现,但实际效果取决于硬件稳定性、负载分布和模型质量。非法律意见:仅供参考,不构成任何合同、保证或投资建议。vLLM 官方版本需与 CUDA 驱动匹配;量化模型质量可能轻微下降(<5%),不适合对准确性极致要求场景。GPU 散热、电源冗余、数据备份是生产必备;超高并发(>500 req)建议多节点。\n\n延伸阅读:\n- GrokCode 模型天梯\n- API 中转检测器\n- 本地部署实验室\n- 官方 vLLM 部署指南(独立主题参考)\n\n## English summary\n\nThis GrokCode production checklist for vLLM local deployment covers concurrency tuning, memory sizing, quantization benchmarks, and TCO calculations for 2026 hardware. vLLM is the go-to choice for reliable on-prem serving due to PagedAttention and OpenAI compatibility, delivering 10-50x better throughput than alternatives. Real-world tests on RTX 5090/A100/H100 show quantized 32B models achieving 1000+ tok/s at 128 concurrency with 90% GPU utilization. Use the provided tables for sizing (e.g., INT4 reduces 70B VRAM to ~40 GB) and the troubleshooting matrix to avoid OOM or queueing issues. TCO examples range from ¥2,300/month for a single 5090 setup to ¥73,000 for dual H100 production. Always validate with your actual workload; this is not legal advice—focus on lab-measured facts for verifiable results.\n\n(正文字数约 2850,去除空白后中文为主)

适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。