模型天梯 · 闭源
多维复核更新 2026/8/2 02:39:58
bench_v1 四维AA 覆盖 6/10高一致 2均一致分 67OpenRouter OK用量榜 OK
bench_v1 种子 × OpenRouter Artificial Analysis × 用量榜交叉复核;种子≠官方认证,冲突时以实测实验室为准。
- 能力:数学 / 英文知识 / 中文综合 / 代码(bench_v1 固定题库)
- 外部基准:OpenRouter 透出的 Artificial Analysis 智力 / 代码 / Agent
- 流量:OpenRouter 日用量榜名次(热度,≠ 能力)
- 一致分:bench 排名 vs AA 智力排名接近程度(0–100)
- 自测:API 实验室 可对任意 Base+Key 复跑题库
种子分 ≠ 官方认证。冲突时优先看一致分与实验室实测;价格见 官方 API / 模型目录。
| 排名 | 模型 | 数学 | 英文 | 中文 | 代码 | 平均 | AA智力 | AA代码 | 一致 | 用量 | 置信 | 类型 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 🥇 | Claude Opus 5 闭源/占位基线,非实验室实测 +1 | 96.0 | 95.5 | 93.0 | 88.0 | 93.1 | — | — | — | #14 | 仅种子 | 闭源 |
| 🥈 | GPT-5.6 Sol 闭源/占位基线,非实验室实测 +1 | 95.0 | 95.0 | 92.0 | 87.0 | 92.3 | — | — | — | #23 | 仅种子 | 闭源 |
| 🥉 | Claude Sonnet 5 闭源/占位基线,非实验室实测 | 93.0 | 93.5 | 91.5 | 84.0 | 90.5 | 53.4 | 71.5 | 100 | #11 | 高一致 | 闭源 |
| 4 | GPT-5.5 闭源/占位基线,非实验室实测 +1 | 93.5 | 94.0 | 91.0 | 83.0 | 90.4 | — | — | — | #41 | 仅种子 | 闭源 |
| 5 | Kimi K3 闭源/占位基线,非实验室实测 | 92.5 | 91.0 | 94.0 | 82.0 | 89.9 | 57.1 | 76.2 | 56 | #9 | 中等 | 闭源 |
| 6 | Claude Sonnet 4.6 闭源/占位基线,非实验室实测 | 91.0 | 93.0 | 91.0 | 78.0 | 88.3 | 47.2 | 63.0 | 78 | — | 高一致 | 闭源 |
| 7 | Grok 4.5 闭源/占位基线,非实验室实测 | 91.0 | 92.0 | 88.0 | 81.0 | 88.0 | 53.8 | 72.4 | 44 | #24 | 低一致 | 闭源 |
| 8 | Gemini 3.5 Flash 闭源/占位基线,非实验室实测 | 90.0 | 90.5 | 89.0 | 79.0 | 87.1 | 36.5 | 49.3 | 67 | #35 | 中等 | 闭源 |
| 9 | GPT-4o 闭源/占位基线,非实验室实测 +1 | 92.0 | 94.0 | 90.0 | 72.0 | 87.0 | — | — | — | #38 | 仅种子 | 闭源 |
| 10 | Gemini 2.5 Pro 闭源/占位基线,非实验室实测 | 90.0 | 91.0 | 88.0 | 70.0 | 84.8 | 25.8 | 33.3 | 56 | #68 | 中等 | 闭源 |
共 10 个模型 · 排序:bench 平均分降序 · AA/用量为交叉复核 · 复核于 2026-08-01 18:39:58 UTC
站內推薦
同系工具:Clavue CLI / imux IDE / clavue-2.1
Clavue · CLI 与 Agent 平台
CLI / GUI Agent 运行时、设备登录、会员额度与 OpenAI 兼容 API(api.clavue.com)。开发脚本、CI 与本地工具一条链路。
打开 Clavue ↗imux · 原生 macOS AI IDE
Clavue 平台的原生 IDE:多 Agent 分屏、Ghostty 级终端、Agent Chat、浏览器自动化与 Supervisor——不是又一个 Electron 壳。
了解 imux ↗Clavue 2.1 · 产品级大模型
旗舰模型 clavue-2.1(及 fast / pro / rev):适合复杂推理与长程 Agent 循环。Chat、imux、API 共用会员额度。
查看模型 ↗