vLLM 本地部署生产清单:并发、显存、量化
GrokCode 品牌专题:vLLM 本地部署生产清单:并发、显存、量化。 锚点:vLLM。

vLLM 本地部署生产清单:并发、显存、量化
GrokCode 视角直接给出答案: 如果你想在自家显卡上跑 vLLM 做生产级模型服务,同时控制好每秒 token 数(并发)、显存占用和显卡使用率,就需要这份「生产清单」。它适合拥有 16GB+ 显存、愿意花 1-2 小时实际测试的本地部署爱好者和中小团队。决策核心只有一句话:显存占用率 + 预估并发 QPS 不能超过显存的 70%,再根据量化级别调整。
核心概念与术语
- vLLM:基于 PagedAttention 的高吞吐量 LLM 推理引擎,专门为服务端部署设计(非 ChatGPT、Claude Code 或 Grok API 的远程调用)。
- 并发(Concurrency):同时处理的请求数量,一般用
vllm serve的--host和--port配置后,通过工具压测得到。 - 显存(GPU Memory):显卡总显存减去系统占用后可用于模型的剩余量,单位 GB 或 GB/s。
- 量化(Quantization):将模型参数精度从 FP16/FP32 降为 INT4/INT8/NF4 等,减少显存占用同时可能牺牲少量准确率。
- PagedAttention:vLLM 核心技术,按需分配 KV Cache 内存,避免连续大块分配浪费。
决策表:vLLM 生产配置对照
| 场景 | 推荐显存(GB) | 推荐量化 | 典型并发(QPS) | 预估显存占用率 | 适用条件 |
|---|---|---|---|---|---|
| 轻量服务(聊天) | 8-12 | INT8 或 NF4 | 5-15 | 60-70% | 单卡 RTX 4090 / A6000 |
| 中等生产(日常使用) | 16-24 | INT4 | 15-40 | 65-75% | 双卡 4090 / A100 40GB |
| 高并发推理 | 24-40+ | NF4 或 AWQ | 40-100+ | 60-70% | 多卡或专业服务器 |
数据来源:以官方/挂牌页当日数据为准。实际测试中,同一模型在不同量化下显存占用会浮动 10-20%,建议现场跑 vllm.benchmark 确认。
实操清单:vLLM 本地部署生产清单(可核对版)
- 环境准备
安装最新 vLLM:pip install vllm(推荐从源码编译以支持最新 PagedAttention)。 确认 CUDA 版本与驱动匹配(至少 12.0+)。
- 模型下载与量化
从 Hugging Face 下载原始模型(推荐 Llama-3.1-8B、Qwen2.5-14B 等)。 执行量化命令: `` python -m vllm.quantize <model> --quantize nf4 --output-dir quantized-model `` 或使用 AWQ/GPTQ 工具(GrokCode 工具页提供现成脚本)。
- 启动服务(生产模式)
`` python -m vllm.entrypoints.openai.api_server \ --model quantized-model \ --port 8000 \ --host 0.0.0.0 \ --tensor-parallel-size 1 \ --max-model-len 8192 \ --gpu-memory-utilization 0.7 \ --max-num-seqs 128 \ --enable-chunked-prefill true ` 关键参数解释:gpu-memory-utilization 直接控制显存占用率;max-num-seqs` 限制并发数。
- 性能验证
使用 vLLM 自带基准工具: `` python -m vllm.benchmark \ --model quantized-model \ --batch-size 1 \ --num-prompts 100 \ --num-iters 5 ` 或通过 GrokCode 工具页提供的 vllm-benchmark` 脚本一键压测。
- 监控与调优
部署后用 nvidia-smi 实时查看显存占用;通过 Prometheus + Grafana 搭建监控(推荐 /tools/local-deploy 页面提供的监控模板)。 发现显存占用率 >75% 时,立即调低 max-num-seqs 或切换更激进量化。
- 生产运维
开启 vllm serve 的多进程模式,设置 max-num-seqs 为 128-256,结合 Redis 做请求队列。 每周跑一次性能复测,记录每条命令的参数组合。
常见坑与风险边界
- 显存溢出:默认
gpu-memory-utilization设置过高,模型加载失败或 OOM。解决方案:从 0.65 开始递减 0.05 测试。 - 并发瓶颈:高并发下 KV Cache 内存暴涨,导致 PagedAttention 失效。边界:单卡最高稳定 100+ QPS(取决于模型大小)。
- 量化精度损失:INT8 以上通常肉眼不可感知,NF4 降 4 位可能降低 0.2-0.5% 准确率。建议生产环境至少保留 INT8 备份。
- 驱动版本冲突:CUDA 12.4+ 必须,否则会报
CUDA error: no kernel image。GrokCode 工具页有驱动校验脚本。 - 资源争抢:与桌面游戏或本地 IDE 同时使用显卡,显存会被抢占,生产必须独占。
非法律意见声明:以上配置仅供工程参考,实际效果以你的显卡型号、模型和当天测试数据为准。GrokCode 不对因使用本清单产生的任何损失或故障承担责任。
站内路径
- 相关工具与页面:
API 中转与检测工具 本地部署实验室工具页 模型天梯对比 官方 API 接入指南 vLLM 专属生产清单完整版 Grok API 中转倍率工具
English summary
vLLM is the production-ready local inference engine from GrokCode’s local deployment laboratory, optimized for high throughput with PagedAttention. This guide gives a complete checklist covering concurrency limits, GPU memory usage, and quantization strategies to keep GPU utilization below 70-75% for stable service. Decision table shows exact GB, quantization level, and expected QPS for different scenarios. Step-by-step checklist covers environment setup, model quantization, server launch with precise parameters, performance benchmarking, monitoring, and ongoing tuning. Common pitfalls include OOM errors, KV Cache explosion under high concurrency, and driver conflicts—always test incrementally. This engineering checklist is fully verifiable and directly links to GrokCode’s API transit and local deploy tools for real-world production use.
适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。