Compute Tool

本地算力部署计算器

选显卡(或自定义显存)、多卡张量并行/副本、模型档与量化,估算能否部署吞吐与日产出 Token本地 vs API 费用最佳配置。 支持官方价一键填入与分享链接。知识背景见 显存对照本地部署算力账; 纯 API 账单用 Token 成本速算; 开源模型下载见 开源模型频道;两套硬件/模型可开「双方案对比」Tab。

能力边界 · 本地算力部署计算器按 GPU×模型×量化×多卡估算能否部署、吞吐、日产出 Token、本地费用与 vs API 回本;支持自定义显存、官方价填入与分享链接。

能做什么

  • 有卡 / 自定义显存 → 可跑模型档与推荐量化/引擎
  • 多卡:张量并行拼显存 或 多副本扩 QPS
  • 目标模型 → 最佳配置(含 1/2/4 卡方案)
  • 日用量 × 电费/折旧/租卡 vs API;官方价一键填入
  • 配置序列化到 URL,可复制分享
  • 估算 tok/s 与日 output 产能

不能 / 不是

  • 不是真实压测,吞吐/TP 效率为启发式
  • 不保证具体权重/GGUF 一定能加载
  • NVLink vs PCIe 带宽差异需实测
  • 不含机架、带宽、人工运维全成本

结果怎么读

  • 舒适 = 显存有余量;偏紧 = 能跑但别硬开长上下文/并发
  • 有效显存 = 单卡 × 卡数 × 0.88(TP 损耗)
  • 本地 $/M out 随利用率上升而下降
  • 回本天数仅在 API 日费明显更高时有意义

数据与额度边界

  • 本机纯计算
  • 矩阵为 2024–2026 选型启发式

可信度:选型量级可信;上线前必须实测。

输入显卡 / 自定义显存 / 多卡并行 / 模型档,估算能否部署吞吐 tok/s日产出 Token本地 vs API 费用最佳配置。 支持分享链接官方价一键填入。数值为启发式,须实测。

✓ 自定义显存✓ 多卡 TP/副本✓ 官方价 / 分享✗ 非真实压测

RTX 4090 24GB 可部署模型档

模型档推荐量化适配约需 / 有效显存吞吐引擎
0.1B–7B
RAG 索引 · 召回
Q5舒适~3 / 24 GB~257.1 tok/sOllama / vLLM
3B–9B
本地助手 · 边侧设备
Q5舒适~9.1 / 24 GB~90 tok/sOllama / vLLM
VL 2B–10B
文档 OCR · 截图问答
Q5舒适~12.1 / 24 GB~64.3 tok/sOllama / vLLM
13B–14B
写作 · 中等 coding
Q4舒适~12.3 / 24 GB~55.6 tok/sOllama / vLLM
32B–34B
强 coding · 中文综合
Q4偏紧~22.2 / 24 GB~29.5 tok/sOllama / vLLM
本地算力部署计算器 · 多卡/自定义显存与费用 · GrokCode 倍率榜