API Lab

API 测速与能力实验室

类似 17ce 的链路测速,加上模型数值能力验真:数学 / 英文知识 / 中文综合 / 代码 → 平均分,对照天梯基线判断是否疑似降智或注水。

TTFT / 吞吐稳定性成功率bench_v1 四维Key 不落库
能力边界 · API 测速实验室深度验收:速度分布 + 固定题库能力分,辅助判断是否疑似降智。

能做什么

  • 多轮测 TTFT / Total / 吞吐 tok/s 与成功率
  • bench_v1:数学 / 英文 / 中文 / 代码四维固定题
  • 与天梯种子基线对比,给出接近/偏低标签
  • Key 默认不落库;可导入监控

不能 / 不是

  • 不是官方 MMLU/GPQA 认证榜,题量有限
  • 不能证明「一定是官方 checkpoint」
  • 延迟含本站到目标链路,受机房与目标负载影响
  • 长题/多轮会消耗可观额度,请自控次数

结果怎么读

  • 成功率 < 100% → 稳定性问题优先于能力分
  • 平均分远低于天梯同名基线 → 疑似降智/路由到小模型
  • TTFT 高但总分高 → 能打但慢,看业务是否可接受
  • 基线缺失 → 只做横向对比,勿过度解读绝对值

数据与额度边界

  • bench_v1 每维约 3 题,方差大,适合筛异常非精排
  • 人机校验 + 限流防滥用
  • 流式不支持时会降级非流式并标注

可信度:筛「明显注水/挂掉」很有效;细粒度排名请结合天梯 + 多源。

加载实验室…

API 测速实验室 · 能力验真 · GrokCode 倍率榜