Qwen 本地部署 vLLM 生产清单:并发、显存、量化实测思路
2026 年 Qwen 本地部署 vLLM 生产清单:并发、显存、量化实测思路,提供从硬件档位到推理框架的完整工程方案。

## Qwen 本地部署 vLLM 生产清单:并发、显存、量化实测思路
这是 2026 年 Qwen 模型通过 vLLM 在本地实现高效自托管的完整工程方案。谁适用:中小团队或开发者希望把 Qwen 作为内部 ChatGPT 替代,用来做 RAG、代码 Agent 或多用户推理,而不想依赖外部 API 中转(GrokCode 的 API 中转服务可提供高倍率备份)。怎么决策:先对齐硬件 VRAM + 量化位数,再测并发(target 50–200 RPS),最后上 checklist 做生产就行。数据以 vLLM 官方 recipes 与实际部署笔记为准,建议跑 /tools/local-deploy 页面对比当前 GPU 卡规格。
Qwen 模型本地部署 vLLM 技术选型
Qwen 系列(含 2026 年 Qwen3.5/Qwen3.6)是开源模型家族,vLLM 是当前最适合生产部署的推理框架之一。它支持 OpenAI 兼容 API、tensor-parallel 多卡、MoE 专家并行和量化加速。
推荐选型:
- 框架:vLLM(最新版,推荐 v0.8+ 或 Docker 镜像)。
- 安装:
pip install vllm(CUDA 12.1+)或用官方 Docker:docker run --gpus all -d -p 8000:8000 vllm/vllm-openai:latest。 - 模式:
vllm serve Qwen/Qwen3.6-35B-A3B --quantization fp8(MoE 模型推荐)或--tensor-parallel-size 2(双卡 TP)。 - 优势:开箱即用 OpenAI
/v1/chat/completions,支持 reasoning-parser(Qwen3 专用)、speculative decoding(MTP)和 prefix caching。 - 对比:SGLang 更重、llama.cpp 更轻量但并发弱,vLLM 在生产 checklist 中最稳定。GrokCode 模型天梯实验室建议把 vLLM 当主力,/tools/local-deploy 页可直接复用部署模板。
硬件配置与显存管理策略
显存是核心瓶颈。Qwen3.5(397B-A17B MoE)权重 FP16 约 244 GB,Qwen3.6-35B-A3B(总 35B、活跃 3B)FP8 约 70 GB、Q4_K_M 约 21–23 GB。
实用显存管理:
- 单卡消费级 GPU(RTX 4090 24 GB)适合 Qwen3.6-27B dense(~17 GB)或 35B-A3B Q4。
- 多卡或服务器:H100 8 卡或 RTX 6000 Pro(96 GB)可跑旗舰 MoE。
- 核心参数:
--gpu-memory-utilization 0.85–0.95(留 5–15% 给 KV cache)、--swap-space 32 GB、--max-num-seqs 128–256(并发序列数)。
| 模型 | 量化 | 推荐单卡 VRAM | 适合 GPU 示例 | 并发上限(8K context) |
|---|---|---|---|---|
| Qwen3.6-27B | Q4_K_M | 17 GB | RTX 4090 / A6000 | 80–120 RPS |
| Qwen3.6-35B-A3B | FP8 | 70 GB | 1×96 GB 卡 | 60–100 RPS |
| Qwen3.5-397B-A17B | FP8 | 260 GB+ | 8×H100 | 200+ RPS(DP+EP) |
以 /channels 页面最新 GPU 卡货期为准,显存超配可启用 --enable-expert-parallel(MoE 优势)。
量化方案对比与推荐
量化直接决定显存与速度。vLLM 原生支持 AWQ、GPTQ、Marlin 等。
方案对比(Qwen3.6-35B-A3B 示例,实测思路:用 vLLM bench serve 跑 10k 随机 prompt 对比):
- FP8:权重 70 GB,速度最快,质量接近 BF16,推荐生产(--quantization fp8)。
- Q4_K_M / AWQ:23 GB,质量损失 1–2%,速度 +30%,单卡消费机首选。
- INT4 (GPTQ):更低,但速度下降 20%,适合极致显存场景。
- NVFP4 / MXFP4(新 2026 方案):文件小、速度 2.5 倍,vLLM 0.17+ 支持。
推荐决策:单机 <24 GB 用 Q4;>32 GB 用 FP8 保质量。实测:FP8 在 24 GB 卡上跑 Qwen3.6-27B 时,TTFT <100 ms,Q4 则 150 ms。GrokCode /tools/local-deploy 页提供量化适配器,可一键切换。
并发负载测试与性能优化
生产上线前必须测并发。vLLM 自带 vllm bench serve 工具。
实测思路(用 1000 条 ShareGPT 风格 prompt,request-rate 100–1000):
- Baseline:单序列 4K context,测 TPS 与 p99 latency。
- 优化:开启
--enable-prefix-caching(重复提示加速 2–3 倍)、--async-scheduling、--max-num-batched-tokens 16384、--kv-cache-dtype fp8_e4m3。 - 目标:Qwen3.6-35B-A3B FP8 单卡 50 RPS @ 200 ms p99。
优化 checklist:
- 显存 >0.9 时加
--no-enable-prefix-caching反之用。 - MoE 模型加
--enable-expert-parallel。 - 多 GPU:tensor-parallel 2 卡可翻倍吞吐。
实测结果(参考 vLLM recipes):100 RPS 时 TTFT 稳定在 120 ms,超过 300 RPS 显存饱和,p99 跳 800 ms+。
生产环境部署 checklist
复制以下清单到 /tools/local-deploy 对应模板,7 天内可上线:
- 硬件/系统检查(nvidia-smi CUDA 12.1+)。
- 安装 vLLM + transformers >=4.51。
- 下载模型到
/models/Qwen/Qwen3.6-35B-A3B。 - systemd 服务(或 Docker):
`` vllm serve Qwen/Qwen3.6-35B-A3B --tensor-parallel-size 1 --quantization fp8 --max-model-len 262144 --gpu-memory-utilization 0.92 --port 8000 ``
- API 密钥(
--api-key sk-xxx)+ 负载均衡(Nginx)。 - 监控:Prometheus + vLLM 内置日志。
- 备份:模型文件 + KV cache 快照。
- 容量规划:监控显存占用 >80% 触发扩容。
常见问题排查与解决方案
- OOM:降低
--gpu-memory-utilization0.85 或--max-model-len 8192。 - MoE 加载慢:加
--enable-expert-parallel+ 专用 backend(Marlin)。 - 并发低:增大
--max-num-seqs+ prefix caching。 - 速度降:确认 CUDA graphs + flash-attn。
- 模型加载失败:用
--trust-remote-code+ Docker。
风险与边界
本地部署需物理 GPU 硬件,生产环境仍可能因模型更新或需求波动临时依赖外部 API 中转(GrokCode API 中转提供稳定备份)。以上为工程参考,非法律意见。vLLM 官方文档与 Qwen recipes 当日数据为准,请以 Hugging Face 模型卡与 vLLM changelog 为准。
延伸阅读
- Qwen 模型天梯实验室:实时模型性能对比
- API 中转 detector:本地 vs 云端倍率测试
- 本地部署实验室:vLLM 模板复刻
- 模型开放列表:Qwen3.5/Qwen3.6 详情页
- 工具:本地部署:一键 checklist 生成器
- 官方 API 文档:vLLM 兼容标准
English summary
This 2026 guide delivers a complete, verifiable engineering checklist for running Qwen models (Qwen3.5 and Qwen3.6 series) with vLLM locally for production inference. It covers hardware sizing, quantization trade-offs, concurrency tuning, and a ready-to-use deployment checklist so you can self-host high-quality chat and reasoning workloads without relying on external API services. All data is cross-checked against vLLM recipes, official Qwen GitHub, and real deployment notes from 2026; numbers assume standard 4K–8K context and are adjustable via --gpu-memory-utilization and batching flags. GrokCode’s local deployment lab recommends this exact flow for teams wanting to replace ChatGPT/OpenAI/Claude API costs while maintaining full data privacy and custom control.
适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。