硬件入门11 分钟

本地大模型部署入门:Ollama / vLLM / llama.cpp

从选框架、下模型、占显存到对外 OPC 服务,理清本地 LLM 最小可行路径与常见坑。

你要选哪条栈

框架适合特点
Ollama个人/快速试用安装简单,模型管理友好
llama.cppCPU/Apple/小 GPU量化生态强,跨平台
vLLM服务化高吞吐连续批处理、生产推理常见
MLXApple Silicon统一内存优化
TensorRT-LLMNVIDIA 极致优化工程成本更高

个人学习:Ollama / llama.cpp。 要对齐 OpenAI 兼容接口给业务:vLLM 或带 OPC 的网关(见 OPC 入门)。

最小路径(概念步骤)

  1. 确认显存是否覆盖目标模型档(见 显存对照部署计算器
  2. 安装框架与 NVIDIA 驱动 / CUDA(或 Apple 对应运行时)
  3. 拉取量化权重(优先知名量化源,校验哈希)
  4. 本地对话验证质量与速度
  5. 打开 API 端口(仅内网或加鉴权!)
  6. 用本站检测器/实验室思路做连通与延迟自测

安全底线

  • 本地 API 默认不要暴露公网
  • 必须暴露时:反向代理 + HTTPS + 密钥 + 限流(见 API Key 安全限流
  • 不要把生产密钥写进仓库或截图

性能调参直觉

  • 上下文越长,KV cache 越大,显存越紧
  • 并发上来后,先降 max_model_len 或加卡,而不是盲目换更大模型
  • 投机采样、前缀缓存等高级特性按框架文档开启

与中转 / 官方 API 混部

常见架构:敏感链路走本地,高峰与冷门模型走 /api-transit 或官方 API。 用统一 OPC 客户端切换 base_url 即可。

边界

本页不提供破解、绕过授权或违法用途的操作细节。部署需遵守模型许可证与当地法规。

适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。