本地算力部署计算器
选显卡(或自定义显存)、多卡张量并行/副本、模型档与量化,估算能否部署、吞吐与日产出 Token、本地 vs API 费用与最佳配置。 支持官方价一键填入与分享链接。知识背景见 显存对照、本地部署、算力账; 纯 API 账单用 Token 成本速算; 开源模型下载见 开源模型频道;两套硬件/模型可开「双方案对比」Tab。
能力边界 · 本地算力部署计算器按 GPU×模型×量化×多卡估算能否部署、吞吐、日产出 Token、本地费用与 vs API 回本;支持自定义显存、官方价填入与分享链接。
能做什么
- 有卡 / 自定义显存 → 可跑模型档与推荐量化/引擎
- 多卡:张量并行拼显存 或 多副本扩 QPS
- 目标模型 → 最佳配置(含 1/2/4 卡方案)
- 日用量 × 电费/折旧/租卡 vs API;官方价一键填入
- 配置序列化到 URL,可复制分享
- 估算 tok/s 与日 output 产能
不能 / 不是
- 不是真实压测,吞吐/TP 效率为启发式
- 不保证具体权重/GGUF 一定能加载
- NVLink vs PCIe 带宽差异需实测
- 不含机架、带宽、人工运维全成本
结果怎么读
- 舒适 = 显存有余量;偏紧 = 能跑但别硬开长上下文/并发
- 有效显存 = 单卡 × 卡数 × 0.88(TP 损耗)
- 本地 $/M out 随利用率上升而下降
- 回本天数仅在 API 日费明显更高时有意义
数据与额度边界
- 本机纯计算
- 矩阵为 2024–2026 选型启发式
可信度:选型量级可信;上线前必须实测。
输入显卡 / 自定义显存 / 多卡并行 / 模型档,估算能否部署、吞吐 tok/s、日产出 Token、本地 vs API 费用与最佳配置。 支持分享链接与官方价一键填入。数值为启发式,须实测。
✓ 自定义显存✓ 多卡 TP/副本✓ 官方价 / 分享✗ 非真实压测
RTX 4090 24GB 可部署模型档
| 模型档 | 推荐量化 | 适配 | 约需 / 有效显存 | 吞吐 | 引擎 |
|---|---|---|---|---|---|
| 0.1B–7B RAG 索引 · 召回 | Q5 | 舒适 | ~3 / 24 GB | ~257.1 tok/s | Ollama / vLLM |
| 3B–9B 本地助手 · 边侧设备 | Q5 | 舒适 | ~9.1 / 24 GB | ~90 tok/s | Ollama / vLLM |
| VL 2B–10B 文档 OCR · 截图问答 | Q5 | 舒适 | ~12.1 / 24 GB | ~64.3 tok/s | Ollama / vLLM |
| 13B–14B 写作 · 中等 coding | Q4 | 舒适 | ~12.3 / 24 GB | ~55.6 tok/s | Ollama / vLLM |
| 32B–34B 强 coding · 中文综合 | Q4 | 偏紧 | ~22.2 / 24 GB | ~29.5 tok/s | Ollama / vLLM |
当前组合:RTX 4090 24GB × 32B–34B × Q4 → 偏紧,需 ~22.2GB / 有效 24GB。消费级单卡跑 32B:推荐 ollama + Q4;Agent 长上下文建议 concurrent=1。 详见 显存对照 · 本地部署。
站内推荐
同系工具:Clavue CLI / imux IDE / clavue-2.1
Clavue · CLI 与 Agent 平台
CLI / GUI Agent 运行时、设备登录、会员额度与 OpenAI 兼容 API(api.clavue.com)。开发脚本、CI 与本地工具一条链路。
打开 Clavue ↗imux · 原生 macOS AI IDE
Clavue 平台的原生 IDE:多 Agent 分屏、Ghostty 级终端、Agent Chat、浏览器自动化与 Supervisor——不是又一个 Electron 壳。
了解 imux ↗Clavue 2.1 · 产品级大模型
旗舰模型 clavue-2.1(及 fast / pro / rev):适合复杂推理与长程 Agent 循环。Chat、imux、API 共用会员额度。
查看模型 ↗