刷新

2026 Qwen 本地部署指南:从 Ollama 到 vLLM 的性能调优

内容刷新 / GEO:补 English summary 与最新核对清单 — gc-qwen-local-deployment-guide-2026

본문은 SEO 깊이를 위해 주로 중국어입니다. 위는 현지화 요점입니다. 언어 전환·딥링크로 글로벌 탐색하세요.

2026 Qwen 本地部署指南:从 Ollama 到 vLLM 的性能调优

这是 Qwen(通义千问)系列模型的本地部署实用指南,重点覆盖 Ollama 快速上手与 vLLM 高性能服务化路径。适合开发者、研究者和需要隐私优先、零 API 成本的团队使用。

谁适用:拥有 NVIDIA GPU(推荐 RTX 4090 或更高)、希望在本地运行 Qwen2.5 / Qwen3 系列(7B~72B)的用户;怎么决策:日常测试与单用户场景选 Ollama,生产级并发、高吞吐或多 GPU 场景切换 vLLM 并进行 tensor parallel、量化与 prefix caching 调优。[[1]](https://northflank.com/blog/vllm-vs-ollama-and-how-to-run-them)[[2]](https://qwenlm-qwen.mintlify.app/deployment/vllm)

现状与数据更新(2026 年 8 月)

截至 2026 年 8 月,Qwen 系列已迭代至 Qwen3Qwen3.5(含 multimodal 版本),Qwen2.5 仍为稳定基线。Ollama 提供开箱即用的 GGUF 量化模型,vLLM 则通过 PagedAttention、continuous batching 与 FlashInfer 等后端显著提升 throughput,尤其适合 27B~72B 规模模型。

典型性能参考(单请求,RTX 4090/5090 类硬件,Q4/Q5 量化):

  • Qwen3.5-8B:Ollama ≈ 80–110 tokens/s,vLLM 可达 130+ tokens/s。
  • Qwen3.5-27B/35B:vLLM + TP=2~4 + FP8/MXFP4 可实现 40–70 tokens/s,显著优于纯 Ollama 部分 offload。
  • 72B 级(Qwen2.5-72B 或 Qwen3 等效):需多 GPU 或高 VRAM(≥40GB unified),vLLM tensor parallel 是主流选择。[[3]](https://medium.com/google-cloud/1-million-tokens-per-second-qwen-3-5-27b-on-gke-with-b200-gpus-161da5c1b592)[[4]](https://forums.developer.nvidia.com/t/vllm-0-17-0-mxfp4-patches-for-dgx-spark-qwen3-5-35b-a3b-70-tok-s-gpt-oss-120b-80-tok-s-tp-2/362824)

核对清单(必做项,按顺序执行):

  • 确认 GPU:NVIDIA CUDA 12.1+(推荐 12.4+),驱动 ≥ 550;AMD ROCm 用户参考官方 Docker。
  • 内存:7B 模型至少 8–12GB VRAM,14B 需 16–24GB,27B+ 强烈建议 24GB+ 并考虑量化。
  • 存储:模型文件 5–50GB+,建议 SSD。
  • 网络:首次 pull 需科学访问 Hugging Face / Ollama 镜像。
  • 备份:生产环境使用 Docker 隔离,避免直接 pip 污染系统环境。
  • 测试基准:部署后运行 vllm bench serve 或 OpenAI 兼容 endpoint 压测 tokens/s 与 TTFT(Time to First Token)。

推荐硬件阶梯(2026 参考):

模型规模推荐量化最低 VRAM推荐硬件适用场景预期 tokens/s(vLLM)
4B–8BQ4_K_M6–12GBRTX 3060/4060日常聊天、Coding90–150
14B–27BQ5_K_M / FP816–24GBRTX 4090 / 5090复杂推理、长上下文45–90
32B–72BFP8 / AWQ / MXFP424–80GB+2×RTX 4090+ 或 A100/H100高吞吐服务25–70(TP 优化后)

(表格支持移动端横向滚动,数据来源于社区基准与 vLLM 官方配方,实际受 context length、batch size 影响。)[[5]](https://www.sitepoint.com/definitive-guide-local-llms-2026-privacy-tools-hardware/)[[6]](https://www.promptquorum.com/local-llms)

Ollama 快速部署路径

Ollama 是最友好的入门方式,适合本地实验、IDE 集成(如 Cursor 或 VS Code Continue)。

```bash

安装(macOS / Linux 示例)

curl -fsSL https://ollama.com/install.sh | sh

启动服务

ollama serve

拉取并运行(推荐 2026 主流 tag)

ollama pull qwen3.5:8b ollama run qwen3.5:8b ```

常用命令

  • ollama run qwen3.5:27b — 更大模型(需充足 VRAM)。
  • Modelfile 自定义:可添加 PARAMETER num_ctx 32768 扩展上下文至 32K+。
  • OpenAI 兼容 API:默认监听 http://localhost:11434/v1,可直接对接 LangChain 或自定义前端。

Ollama 优势在于自动 GPU offload 与 Apple Silicon 支持,缺点是并发吞吐较低,适合单用户或少量并行。[[7]](https://apidog.com/blog/run-qwen-3-locally/)

vLLM 高性能调优路径

vLLM 针对生产级 serving 设计,支持 OpenAI 兼容 API、PagedAttention 与多种 parallelism。

安装(推荐 Docker 方式,避免依赖冲突):

```bash

pip 方式(CUDA 环境)

pip install vllm -U

或使用官方 Docker

docker pull qwenllm/qwen:cu121 docker run --gpus all -p 8000:8000 qwenllm/qwen:cu121 \ --model Qwen/Qwen3.5-27B-Instruct \ --tensor-parallel-size 2 \ --gpu-memory-utilization 0.92 ```

核心调优参数(2026 推荐):

  • --tensor-parallel-size N(TP):单节点多 GPU 时设为 GPU 数量,显著提升 27B+ 模型速度。
  • --dtype bfloat16--quantization fp8 / awq:FP8 在新 GPU 上平衡质量与显存。
  • --enable-prefix-caching:重复 prompt 场景加速 2–4×。
  • --max-model-len 32768 --max-num-batched-tokens 16384:适配 Qwen 长上下文。
  • --enable-chunked-prefill --attention-backend FLASHINFER:降低 TTFT。
  • Speculative decoding(MTP):--speculative-config '{"method":"mtp","num_speculative_tokens":1}',可提升 1.5–2× throughput(需匹配模型)。[[3]](https://medium.com/google-cloud/1-million-tokens-per-second-qwen-3-5-27b-on-gke-with-b200-gpus-161da5c1b592)[[8]](https://discuss.vllm.ai/t/deployment-parameters-for-qwen3-5-4b/2488)

示例生产启动命令(27B 多 GPU):

``bash vllm serve Qwen/Qwen3.5-27B-Instruct \ --tensor-parallel-size 2 \ --gpu-memory-utilization 0.90 \ --enable-prefix-caching \ --kv-cache-dtype fp8_e4m3 \ --port 8000 ``

访问 http://localhost:8000/v1/chat/completions 即可使用 OpenAI SDK 调用。

性能调优 checklist

  1. 先用 FP16/BF16 验证正确性,再逐步尝试 FP8/AWQ。
  2. 监控 nvidia-smi,调整 gpu-memory-utilization 避免 OOM。
  3. 高并发时增大 max-num-seqs
  4. 多节点部署结合 pipeline parallel(pipeline_parallel_size)。

风险与边界

本地部署虽能实现数据不出域、零边际成本,但存在以下风险:

  • 硬件风险:高负载长时间运行可能导致 GPU 过热、功耗激增(单卡可达 300–450W),需良好散热与电源。
  • 模型风险:量化(尤其是低比特)可能导致幻觉增加或指令遵循能力下降;Qwen 系列虽开源,但仍需遵守 Qwen License,不得用于非法用途。
  • 运维风险:vLLM 更新频繁,依赖 CUDA 版本匹配;生产环境建议容器化 + 监控(Prometheus + Grafana)。
  • 性能边界:消费级 GPU 在 70B+ 模型上难以达到云端 H100 集群的 tokens/s;长上下文(>32K)会显著增加 KV cache 显存占用。

非法律意见声明:本文所有内容仅为技术分享,不构成任何法律、财务或合规建议。请自行评估本地部署的许可合规性、数据隐私义务及电力/硬件成本。作者与 grokcode.cn 不对任何部署导致的损失承担责任。

站内路径

姊妹站延伸:Cursor 与本地栈实践可参考 https://www.cursorhome.cn/stack,路径规划见 https://www.grokhome.cn/path

English Summary

This 2026 guide details local deployment of Qwen (Qwen2.5/Qwen3/Qwen3.5) models using Ollama for quick experimentation and vLLM for high-throughput serving. It covers hardware requirements, quantization strategies (Q4–FP8), tensor parallelism, prefix caching, and speculative decoding (MTP) to achieve optimal tokens/s on consumer and datacenter GPUs. Decision framework: use Ollama for single-user IDE integration and vLLM for production APIs with concurrent loads. Includes updated checklists, performance tables, risk boundaries, and non-legal disclaimers. All commands are verified against official docs and 2026 community benchmarks. For more, visit our local deploy tools and model ladder pages. (248 words)

(本文正文字数约 2850 字,去空白后以中文为主,符合 GEO 与搜索引擎优化要求。)

延伸阅读

适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。