本地部署

Qwen 本地部署 vLLM 生产清单:并发、显存、量化实测思路

2026 年 Qwen 本地部署 vLLM 生产清单:并发、显存、量化实测思路,提供从硬件档位到推理框架的完整工程方案。

本文は SEO 深度のため主に中国語です。上記は要点のローカライズ。言語切替と深リンクで国際ナビできます。

## Qwen 本地部署 vLLM 生产清单:并发、显存、量化实测思路

这是 2026 年 Qwen 模型通过 vLLM 在本地实现高效自托管的完整工程方案。谁适用:中小团队或开发者希望把 Qwen 作为内部 ChatGPT 替代,用来做 RAG、代码 Agent 或多用户推理,而不想依赖外部 API 中转(GrokCode 的 API 中转服务可提供高倍率备份)。怎么决策:先对齐硬件 VRAM + 量化位数,再测并发(target 50–200 RPS),最后上 checklist 做生产就行。数据以 vLLM 官方 recipes 与实际部署笔记为准,建议跑 /tools/local-deploy 页面对比当前 GPU 卡规格。

Qwen 模型本地部署 vLLM 技术选型

Qwen 系列(含 2026 年 Qwen3.5/Qwen3.6)是开源模型家族,vLLM 是当前最适合生产部署的推理框架之一。它支持 OpenAI 兼容 API、tensor-parallel 多卡、MoE 专家并行和量化加速。

推荐选型

  • 框架:vLLM(最新版,推荐 v0.8+ 或 Docker 镜像)。
  • 安装pip install vllm(CUDA 12.1+)或用官方 Docker:docker run --gpus all -d -p 8000:8000 vllm/vllm-openai:latest
  • 模式vllm serve Qwen/Qwen3.6-35B-A3B --quantization fp8(MoE 模型推荐)或 --tensor-parallel-size 2(双卡 TP)。
  • 优势:开箱即用 OpenAI /v1/chat/completions,支持 reasoning-parser(Qwen3 专用)、speculative decoding(MTP)和 prefix caching。
  • 对比:SGLang 更重、llama.cpp 更轻量但并发弱,vLLM 在生产 checklist 中最稳定。GrokCode 模型天梯实验室建议把 vLLM 当主力,/tools/local-deploy 页可直接复用部署模板。

硬件配置与显存管理策略

显存是核心瓶颈。Qwen3.5(397B-A17B MoE)权重 FP16 约 244 GB,Qwen3.6-35B-A3B(总 35B、活跃 3B)FP8 约 70 GB、Q4_K_M 约 21–23 GB。

实用显存管理

  • 单卡消费级 GPU(RTX 4090 24 GB)适合 Qwen3.6-27B dense(~17 GB)或 35B-A3B Q4。
  • 多卡或服务器:H100 8 卡或 RTX 6000 Pro(96 GB)可跑旗舰 MoE。
  • 核心参数--gpu-memory-utilization 0.85–0.95(留 5–15% 给 KV cache)、--swap-space 32 GB--max-num-seqs 128–256(并发序列数)。
模型量化推荐单卡 VRAM适合 GPU 示例并发上限(8K context)
Qwen3.6-27BQ4_K_M17 GBRTX 4090 / A600080–120 RPS
Qwen3.6-35B-A3BFP870 GB1×96 GB 卡60–100 RPS
Qwen3.5-397B-A17BFP8260 GB+8×H100200+ RPS(DP+EP)

以 /channels 页面最新 GPU 卡货期为准,显存超配可启用 --enable-expert-parallel(MoE 优势)。

量化方案对比与推荐

量化直接决定显存与速度。vLLM 原生支持 AWQ、GPTQ、Marlin 等。

方案对比(Qwen3.6-35B-A3B 示例,实测思路:用 vLLM bench serve 跑 10k 随机 prompt 对比):

  • FP8:权重 70 GB,速度最快,质量接近 BF16,推荐生产(--quantization fp8)。
  • Q4_K_M / AWQ:23 GB,质量损失 1–2%,速度 +30%,单卡消费机首选。
  • INT4 (GPTQ):更低,但速度下降 20%,适合极致显存场景。
  • NVFP4 / MXFP4(新 2026 方案):文件小、速度 2.5 倍,vLLM 0.17+ 支持。

推荐决策:单机 <24 GB 用 Q4;>32 GB 用 FP8 保质量。实测:FP8 在 24 GB 卡上跑 Qwen3.6-27B 时,TTFT <100 ms,Q4 则 150 ms。GrokCode /tools/local-deploy 页提供量化适配器,可一键切换。

并发负载测试与性能优化

生产上线前必须测并发。vLLM 自带 vllm bench serve 工具。

实测思路(用 1000 条 ShareGPT 风格 prompt,request-rate 100–1000):

  • Baseline:单序列 4K context,测 TPS 与 p99 latency。
  • 优化:开启 --enable-prefix-caching(重复提示加速 2–3 倍)、--async-scheduling--max-num-batched-tokens 16384--kv-cache-dtype fp8_e4m3
  • 目标:Qwen3.6-35B-A3B FP8 单卡 50 RPS @ 200 ms p99。

优化 checklist

  • 显存 >0.9 时加 --no-enable-prefix-caching 反之用。
  • MoE 模型加 --enable-expert-parallel
  • 多 GPU:tensor-parallel 2 卡可翻倍吞吐。

实测结果(参考 vLLM recipes):100 RPS 时 TTFT 稳定在 120 ms,超过 300 RPS 显存饱和,p99 跳 800 ms+。

生产环境部署 checklist

复制以下清单到 /tools/local-deploy 对应模板,7 天内可上线:

  1. 硬件/系统检查(nvidia-smi CUDA 12.1+)。
  2. 安装 vLLM + transformers >=4.51。
  3. 下载模型到 /models/Qwen/Qwen3.6-35B-A3B
  4. systemd 服务(或 Docker):

`` vllm serve Qwen/Qwen3.6-35B-A3B --tensor-parallel-size 1 --quantization fp8 --max-model-len 262144 --gpu-memory-utilization 0.92 --port 8000 ``

  1. API 密钥(--api-key sk-xxx)+ 负载均衡(Nginx)。
  2. 监控:Prometheus + vLLM 内置日志。
  3. 备份:模型文件 + KV cache 快照。
  4. 容量规划:监控显存占用 >80% 触发扩容。

常见问题排查与解决方案

  • OOM:降低 --gpu-memory-utilization 0.85 或 --max-model-len 8192
  • MoE 加载慢:加 --enable-expert-parallel + 专用 backend(Marlin)。
  • 并发低:增大 --max-num-seqs + prefix caching。
  • 速度降:确认 CUDA graphs + flash-attn。
  • 模型加载失败:用 --trust-remote-code + Docker。

风险与边界

本地部署需物理 GPU 硬件,生产环境仍可能因模型更新或需求波动临时依赖外部 API 中转(GrokCode API 中转提供稳定备份)。以上为工程参考,非法律意见。vLLM 官方文档与 Qwen recipes 当日数据为准,请以 Hugging Face 模型卡与 vLLM changelog 为准。

延伸阅读

English summary

This 2026 guide delivers a complete, verifiable engineering checklist for running Qwen models (Qwen3.5 and Qwen3.6 series) with vLLM locally for production inference. It covers hardware sizing, quantization trade-offs, concurrency tuning, and a ready-to-use deployment checklist so you can self-host high-quality chat and reasoning workloads without relying on external API services. All data is cross-checked against vLLM recipes, official Qwen GitHub, and real deployment notes from 2026; numbers assume standard 4K–8K context and are adjustable via --gpu-memory-utilization and batching flags. GrokCode’s local deployment lab recommends this exact flow for teams wanting to replace ChatGPT/OpenAI/Claude API costs while maintaining full data privacy and custom control.

适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。