模型进阶10 分钟

推理模型崛起:从 o1 到 DeepSeek-R1

2024-09 o1-preview 到 2025-01 R1:推理溢价、开源冲击与评测口径变化。用月度公榜串起来。

范式切换

2024-09 o1-preview 把「慢思考 / 推理 token」推到台前。 2025-01 DeepSeek-R1 用开源+极低 API 价冲击「推理=贵」的常识。

定价语言变了

模式特征
经典 Chat输入/输出 Token 计价
推理模型额外推理消耗,账单可暴涨
开源推理权重免费,托管/中转仍有成本

跑分怎么读

  • Arena Elo:主观对话偏好,波动大
  • AA Intelligence:独立题库合成,量级约 40–65(现网公榜)
  • 本站实测:网关延迟/连通,见 私榜·实测

不要把 2023 的 MMLU 叙事和 2026 的 AA Index 直接比绝对分

实践建议

  1. 数学/竞赛/硬推理 → 看公榜智力 + 推理档
  2. 日常编码 → Claude/GPT 编码档 + 代码公榜
  3. 预算敏感 → R1/开源 + 性价比公榜 + 中转倍率

延伸

适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。