API 测速与能力实验室
类似 17ce 的链路测速,加上模型数值能力验真:数学 / 英文知识 / 中文综合 / 代码 → 平均分,对照天梯基线判断是否疑似降智或注水。
TTFT / 吞吐稳定性成功率bench_v1 四维Key 不落库
能力边界 · API 测速实验室深度验收:速度分布 + 固定题库能力分,辅助判断是否疑似降智。
能做什么
- 多轮测 TTFT / Total / 吞吐 tok/s 与成功率
- bench_v1:数学 / 英文 / 中文 / 代码四维固定题
- 与天梯种子基线对比,给出接近/偏低标签
- Key 默认不落库;可导入监控
不能 / 不是
- 不是官方 MMLU/GPQA 认证榜,题量有限
- 不能证明「一定是官方 checkpoint」
- 延迟含本站到目标链路,受机房与目标负载影响
- 长题/多轮会消耗可观额度,请自控次数
结果怎么读
- 成功率 < 100% → 稳定性问题优先于能力分
- 平均分远低于天梯同名基线 → 疑似降智/路由到小模型
- TTFT 高但总分高 → 能打但慢,看业务是否可接受
- 基线缺失 → 只做横向对比,勿过度解读绝对值
数据与额度边界
- bench_v1 每维约 3 题,方差大,适合筛异常非精排
- 人机校验 + 限流防滥用
- 流式不支持时会降级非流式并标注
可信度:筛「明显注水/挂掉」很有效;细粒度排名请结合天梯 + 多源。
加载实验室…
Related tools
Clavue CLI / imux IDE / clavue-2.1
Clavue · CLI 与 Agent 平台
CLI / GUI Agent 运行时、设备登录、会员额度与 OpenAI 兼容 API(api.clavue.com)。开发脚本、CI 与本地工具一条链路。
打开 Clavue ↗imux · 原生 macOS AI IDE
Clavue 平台的原生 IDE:多 Agent 分屏、Ghostty 级终端、Agent Chat、浏览器自动化与 Supervisor——不是又一个 Electron 壳。
了解 imux ↗Clavue 2.1 · 产品级大模型
旗舰模型 clavue-2.1(及 fast / pro / rev):适合复杂推理与长程 Agent 循环。Chat、imux、API 共用会员额度。
查看模型 ↗