模型进阶10 分钟

推理模型崛起:從 o1 到 DeepSeek-R1

從 o1-preview 到 DeepSeek-R1:測試時算力成為一級產品軸。

范式切换

2024-09 o1-preview 把「慢思考 / 推理 token」推到台前。 2025-01 DeepSeek-R1 用開源+极低 API 價冲击「推理=贵」的常识。

定價語言变了

模式特征
經典 Chat輸入/輸出 Token 計價
推理模型额外推理消耗,帳單可暴涨
開源推理权重免费,託管/中轉仍有成本

跑分怎么讀

  • Arena Elo:主观對话偏好,波动大
  • AA Intelligence:独立题庫合成,量级约 40–65(現網公榜)
  • 本站實測:網關延遲/连通,見 私榜·實測

不要把 2023 的 MMLU 叙事和 2026 的 AA Index 直接比绝對分

實践建議

  1. 数学/竞赛/硬推理 → 看公榜智力 + 推理档
  2. 日常编碼 → Claude/GPT 编碼档 + 代碼公榜
  3. 预算敏感 → R1/開源 + 性價比公榜 + 中轉倍率

延伸

---

免責聲明: GrokCode 僅聚合公開/提交資訊,不賣貨、不收款、不擔保第三方服務。下單或充值前請回原站核驗。本頁不構成法律意見。

适用于 GrokCode 倍率榜。信息仅供参考,不构成购买、投资或法律意见。