硬件入门约 11 分钟
本地大模型部署入门:Ollama / vLLM / llama.cpp
从选框架、下模型、占显存到对外 OPC 服务,理清本地 LLM 最小可行路径与常见坑。

你要选哪条栈
| 框架 | 适合 | 特点 |
|---|---|---|
| Ollama | 个人/快速试用 | 安装简单,模型管理友好 |
| llama.cpp | CPU/Apple/小 GPU | 量化生态强,跨平台 |
| vLLM | 服务化高吞吐 | 连续批处理、生产推理常见 |
| MLX | Apple Silicon | 统一内存优化 |
| TensorRT-LLM | NVIDIA 极致优化 | 工程成本更高 |
个人学习:Ollama / llama.cpp。 要对齐 OpenAI 兼容接口给业务:vLLM 或带 OPC 的网关(见 OPC 入门)。
最小路径(概念步骤)
- 确认显存是否覆盖目标模型档(见 显存对照 或 部署计算器)
- 安装框架与 NVIDIA 驱动 / CUDA(或 Apple 对应运行时)
- 拉取量化权重(优先知名量化源,校验哈希)
- 本地对话验证质量与速度
- 打开 API 端口(仅内网或加鉴权!)
- 用本站检测器/实验室思路做连通与延迟自测
安全底线
- 本地 API 默认不要暴露公网
- 必须暴露时:反向代理 + HTTPS + 密钥 + 限流(见 API Key 安全、限流)
- 不要把生产密钥写进仓库或截图
性能调参直觉
- 上下文越长,KV cache 越大,显存越紧
- 并发上来后,先降
max_model_len或加卡,而不是盲目换更大模型 - 投机采样、前缀缓存等高级特性按框架文档开启
与中转 / 官方 API 混部
常见架构:敏感链路走本地,高峰与冷门模型走 /api-transit 或官方 API。 用统一 OPC 客户端切换 base_url 即可。
边界
本页不提供破解、绕过授权或违法用途的操作细节。部署需遵守模型许可证与当地法规。
适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。