Tool Suite · 中转站评测

AI 工具箱 · 中转站检测与评测

面向中转站评测与成本核算:检测、多节点测速、API 实验室、倍率换算、Token 成本与价格同步串成一条工作流。每项标明能做什么 / 不能做什么 / 结果怎么读,避免把「通断」当成「真假模型」。可与 中转站大全模型天梯 交叉对照。

必备工具(优先用)

覆盖:通断 → 测速验真 → 成本 → 监控 → 同步定价

连通 · 验真可实测必备
中转模型检测

填 Base URL + Key:预检 /v1/models / Chat 多轮,快速判断中转能不能用。

轻量验收:这个 Base+Key 能不能用、有哪些模型、Chat 能否回包。

中转通断NewAPI
去检测
连通 · 验真可实测必备
API 测速实验室

TTFT / 吞吐 / 成功率 + bench_v1 四维能力分,对照天梯判断是否降智。

深度验收:速度分布 + 固定题库能力分,辅助判断是否疑似降智。

测速验真bench
打开实验室
监控 · 提醒可实测必备
API 定时监控

余额 / 质量 / 能力按 10 分钟起定时探测,失败与恢复发邮件。

挂机观测:按设定频率做余额/质量/能力探测,异常与恢复邮件通知。

监控邮件余额
配置监控
连通 · 验真可实测必备
多节点测速

并行探测最多 6 个 Base URL 的连接、models 与可选 chat 延迟,对比中转节点。

同一机房视角下,并行对比多个 Base 的连通与 models 延迟。

并行延迟对比
多节点探测
成本 · 换算必备
中转成本计算器

官方 Token 价 × 综合倍率,估算日用 / Agent 旗舰线费用(CNY)。

官方 Token 价 × 站点综合倍率,粗算编码/Agent 费用。

倍率CNY成本
估算成本
成本 · 换算必备
NewAPI 倍率换算器

model_ratio / completion_ratio ↔ 输入输出 $/M 双向换算,对齐 NewAPI 计费公式。

把 NewAPI 的 model_ratio 体系与 $/M 单价互相换算,避免调价算错。

model_ratioNewAPI换算
去换算
成本 · 换算必备
Token 成本速算

输入/输出 Token 量 × 单价,秒算单次与百万次费用,支持 USD/CNY。

按用量 × 单价 × 倍率估算单次/合计费用(USD/CNY)。

Token账单速算
去速算
成本 · 换算必备
本地算力部署计算器

显卡×模型能否部署、推荐量化/引擎、Token 产出、本地 vs API 费用与最佳配置方案。

按 GPU×模型×量化×多卡估算能否部署、吞吐、日产出 Token、本地费用与 vs API 回本;支持自定义显存、官方价填入与分享链接。

本地部署显存GPUtok/s
打开计算器
情报 · 选型必备
开源模型部署频道

全球主流开源 LLM:HF / Ollama / GGUF / ModelScope 下载链接 + 显存与部署计算器。

开源OllamaGGUF下载
浏览开源模型
价格 · 同步必备
正式价格 API

NewAPI /api/pricing · Sub2API LiteLLM 表,可作上游同步数据源。

对外提供 NewAPI/Sub2API 可同步的公开价格 JSON。

同步NewAPISub2API
接入文档
价格 · 同步必备
中转倍率榜

综合倍率、7 日可用率、决策四卡。

倍率榜可用率
打开倍率榜

带实测能力

会向你填写的 Base URL 发探测请求,用于验收中转与模型真实性。

验真深度对照 · 选对工具

同一套 API,不同工具回答的问题不同。先看深度与额度风险,再点进详情页的能力边界。

工具验真深度额度风险挂机最适合
中转模型检测通断极低额度接入前 30 秒验收
多节点测速多站延迟低(可选 chat)选哪个节点更快
API 测速实验室速度+能力中(题库多轮)怀疑降智/注水
API 定时监控持续抽检按频率累计生产挂机告警
账单 CSV 对账费用核对无请求账单是否加价

能力边界速览

点进任意工具可看完整「能 / 不能 / 怎么读 / 可信度」。

中转模型检测

轻量验收:这个 Base+Key 能不能用、有哪些模型、Chat 能否回包。

  • 预检 Base URL 是否公网可达(SSRF 拦截内网)
  • GET /v1/models 拉模型列表(需 Key 时带鉴权)
  • 不测真实业务压测 QPS / 并发上限
  • 不做多地区节点对比(请用多节点测速)

可信度:通断结论可信;能力与「真假模型」需升级实验室。

API 测速实验室

深度验收:速度分布 + 固定题库能力分,辅助判断是否疑似降智。

  • 多轮测 TTFT / Total / 吞吐 tok/s 与成功率
  • bench_v1:数学 / 英文 / 中文 / 代码四维固定题
  • 不是官方 MMLU/GPQA 认证榜,题量有限
  • 不能证明「一定是官方 checkpoint」

可信度:筛「明显注水/挂掉」很有效;细粒度排名请结合天梯 + 多源。

多节点测速

同一机房视角下,并行对比多个 Base 的连通与 models 延迟。

  • 最多 6 个 URL 并行
  • 阶段:连接 → /v1/models → 可选 chat
  • 不是全球多地区探针(无香港/美西等分布式节点)
  • 不等于你电脑访问速度

可信度:节点间相对排序可信;绝对值随网络波动。

NewAPI 倍率换算

把 NewAPI 的 model_ratio 体系与 $/M 单价互相换算,避免调价算错。

  • 倍率 → 输入/输出 $/M(含 group_ratio)
  • 单价 → model_ratio / completion_ratio
  • 不代表任何站点「实际扣费」——以账单为准
  • 不处理固定价/按次/图片计费等特殊模型

可信度:公式换算准确;与真实账单需对账工具校验。

账单 CSV 对账

用你设定的单价规则重算「应计费」,对比 CSV 中的 cost 差额。

  • 解析常见表头(model/prompt/completion/cost)
  • 按模型覆盖单价
  • 不保证适配所有厂商导出格式(复杂引号/合并单元格需预处理)
  • 不自动拉取账单,需你粘贴 CSV

可信度:同规则下算术准确;差异原因需结合业务排查。

正式价格 API

对外提供 NewAPI/Sub2API 可同步的公开价格 JSON。

  • GET /api/pricing 兼容 NewAPI type2
  • GET /api/ratio_config 倍率 map
  • 不保证与所有厂商官网实时一致
  • 不是你站点的实际售价

可信度:同步格式正确;价格为聚合参考。

推荐使用路径

  1. 倍率榜 选站 → 多节点测速 对比 → 检测器 通断
  2. 实验室 测速 + 能力分 → 天梯 对照是否降智 → 用量榜 看热度 → 别名表 对齐 model id
  3. 倍率换算 / Token 成本 / 中转成本 算账 → 账单对账
  4. 定时监控 挂机 → 价格 API 同步到 NewAPI/Sub2API

关注侧栏

任意页面右侧「关注」可聚合店铺 / 商品 / API / 监控状态(本机存储)。适合盯店上新与监控异常。

连通 · 验真

成本 · 换算

监控 · 提醒

情报 · 选型

价格 · 同步

运维 · 数据

中转验真实验室

GrokCode 的 /tools 并非简单的功能堆砌,而是针对大模型推理与微调场景的“中转验真实验室”。我们剥离营销叙事,聚焦于算力调用的透明度与确定性。在模型迭代极快的当下,单一倍率参数已无法反映真实可用性,我们提供充值前的健康度检测与本地部署的显存估算,确保每一分投入都对应可量化的性能表现。

本栏目拒绝模糊的“综合体验”描述,转而通过天梯交叉排行与 API 中转链路追踪,还原模型在高压负载下的真实表现。无论是开发者评估 24GB 显存下的量化可行性,还是运维人员排查接口延迟,这里提供的是基于数据的决策依据,而非主观推荐。

常见场景怎么走

充值前健康度自检

预算敏感型开发者

在大规模调用前,利用检测工具验证接口稳定性与延迟基线

避免资金浪费在低质或高延迟的节点上

本站下一步

本地 24GB 显存评估

边缘计算部署者

输入模型参数与量化格式,估算显存占用与推理速度

精准匹配硬件资源,防止 OOM 错误

本站下一步

天梯交叉排行分析

模型选型研究员

对比不同模型在特定任务上的实时排名与波动情况

识别长期稳定模型,避开短期热度陷阱

本站下一步

中转链路追踪

API 集成工程师

检查请求经过的节点路径与响应时间分布

定位网络瓶颈,优化调用策略

本站下一步

渠道质量对比

多模型应用开发者

横向对比不同提供商在相同负载下的表现

构建高可用的多源容灾架构

本站下一步

工具集综合概览

技术决策者

浏览所有可用工具的功能边界与适用场景

快速掌握实验室提供的全部能力

本站下一步

把账算清楚

综合倍率 0.8 的降智陷阱

已知:某模型标称倍率 0.8,但实际输出逻辑混乱

  1. 进入 /ladder 查看该模型近 24 小时的质量评分
  2. 对比同参数规模其他模型的平均准确率
  3. 分析 /api-transit 中的错误率占比
  4. 确认低倍率伴随的是逻辑退化而非成本优化

结论:倍率低不等于性价比高,需结合质量指标综合判断

本地 24GB 显存可行性验证

已知:需部署 7B 参数模型,硬件限制为 24GB 显存

  1. 访问 /tools/local-deploy 输入模型名称
  2. 选择 INT4 量化方案
  3. 观察显存占用估算值是否低于 20GB
  4. 检查剩余显存是否足够支撑上下文窗口

结论:量化后可行,但需限制上下文长度以保稳定

充值前接口稳定性检测

已知:计划充值 100 美元用于批量测试

  1. 使用 /api-transit/detector 进行 10 次连续请求
  2. 记录平均响应时间是否低于 500ms
  3. 检查错误代码是否包含 503 或超时
  4. 确认连续成功率是否高于 95%

结论:若检测通过,可安全充值;否则建议更换节点

本站术语

倍率
模型调用价格与基础模型价格的比值,反映成本效率
降智
模型在特定负载或节点下,逻辑推理能力显著下降的现象
显存估算
预测模型在本地部署时所需的 GPU 内存大小
天梯排行
基于实时数据对模型性能进行的动态排名系统
中转链路
请求从用户到最终模型提供商经过的网络路径
健康度
接口在稳定性、延迟和成功率方面的综合评分
量化
降低模型参数精度以减少显存占用和计算资源的技术
交叉排行
在不同任务维度下对模型进行的对比排名

别这样比

  • 仅凭倍率高低决定充值金额

    结合质量评分与延迟数据评估性价比

  • 忽略本地部署的上下文窗口限制

    根据显存剩余空间动态调整上下文长度

  • 在未检测的情况下直接批量调用

    先进行小样本健康度检测再扩大规模

  • 盲目追求最新发布的模型

    参考天梯排行选择稳定性高的成熟模型

  • 假设所有渠道响应速度一致

    通过中转链路追踪识别并避开高延迟节点

还想确认的

倍率低的模型一定更划算吗?
不一定。低倍率可能伴随降智或高延迟。需结合 /ladder 的质量评分与 /api-transit 的延迟数据综合判断,避免为低成本牺牲输出质量。
24GB 显存能跑多大参数模型?
取决于量化方式。通常 INT4 量化下 7B-13B 参数模型可行,但需使用 /tools/local-deploy 精确估算,并预留显存给上下文窗口。
如何判断接口是否稳定?
使用 /api-transit/detector 进行连续请求测试,关注错误率是否低于 5% 及平均响应时间是否稳定。不稳定接口会导致批量任务失败。
天梯排行数据多久更新一次?
数据实时更新,反映当前节点负载与模型响应情况。建议在高负载时段参考排行,避免选择拥堵节点。
中转链路会影响模型效果吗?
不会改变模型本身,但高延迟或丢包可能导致超时错误。通过 /api-transit 追踪可优化节点选择,提升整体调用成功率。
本地部署需要哪些准备工作?
需确认 GPU 显存大小、驱动版本及量化格式兼容性。使用 /tools/local-deploy 预估资源占用,确保硬件满足最低要求。
为什么不同渠道表现差异大?
各渠道服务器负载、网络路由及模型版本不同。通过 /channels 对比可发现高延迟或低质量节点,选择更优提供商。
充值前必须检测吗?
强烈建议。检测可暴露潜在稳定性问题,避免大额充值后遭遇服务中断或性能不达标,降低试错成本。

接着读

AI 工具箱 · 中转站检测评测 · 倍率换算 · GrokCode 倍率榜