模型进阶约 10 分钟
推理模型崛起:从 o1 到 DeepSeek-R1
2024-09 o1-preview 到 2025-01 R1:推理溢价、开源冲击与评测口径变化。用月度公榜串起来。

范式切换
2024-09 o1-preview 把「慢思考 / 推理 token」推到台前。 2025-01 DeepSeek-R1 用开源+极低 API 价冲击「推理=贵」的常识。
定价语言变了
| 模式 | 特征 |
|---|---|
| 经典 Chat | 输入/输出 Token 计价 |
| 推理模型 | 额外推理消耗,账单可暴涨 |
| 开源推理 | 权重免费,托管/中转仍有成本 |
跑分怎么读
- Arena Elo:主观对话偏好,波动大
- AA Intelligence:独立题库合成,量级约 40–65(现网公榜)
- 本站实测:网关延迟/连通,见 私榜·实测
不要把 2023 的 MMLU 叙事和 2026 的 AA Index 直接比绝对分。
实践建议
延伸
适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。