模型智能能力 · 多维天梯

推理速度

模型生成效率与延迟的客观对比

数据更新于 2026-07-31 · 能力库 206 条(网关 49 · 站外 157 · AA 173 · Arena 100 · 当前榜 89 · OpenRouter 实时已接入 · 知识库 159 模 / 31 族 / 26 维

推理速度 配图

模型天梯 · capability

推理速度

本榜评估AI模型的推理速度表现,重点考察每秒token生成数(tokens/s)、首token延迟(TTFT)及多并发吞吐能力。数据来源于Artificial Analysis(AA)的独立基准测试、LMSYS Arena等平台的性能指标、Hugging Face等开源benchmarks的测速结果、主流API提供商的实际用量统计,以及基于模型架构、参数量和量化级别的启发式估算。解读时需结合具体硬件、部署环境和应用场景,速度仅为独立维度,建议与质量、成本等其他榜单综合参考。

  • tokens/s归一化得分(权重最高)
  • TTFT与端到端延迟测试结果
  • 多并发吞吐量与稳定性指标
显示 89全量 89

列表 89 / 89(全库 89)· 点击「佐证」查看评分依据与测试题面

#模型厂商地区速度分相对说明证据源佐证
🥇grok-4.20-0309-non-reasoning
grok-4.20-0309-non-reasoning
x-ai美国网关100
29.3 tok/s
吞吐 / 延迟
实测OR
查看佐证
🥈grok-4.3-fast
grok-4.3-fast
xai美国网关100
30 tok/s
吞吐 / 延迟
实测OR快照Arena
查看佐证
🥉grok-4.20-0309-non-reasoning-console
grok-4.20-0309-non-reasoning-console
x-ai美国网关94
17.6 tok/s
吞吐 / 延迟
实测OR
查看佐证
4grok-composer
grok-composer
xai美国网关87
15 tok/s
吞吐 / 延迟
探测
查看佐证
5qwen3.6:35b-a3b
qwen3.6:35b-a3b
qwen中国网关87
141 tok/s
吞吐 / 延迟
探测AAOR
查看佐证
6gpt-4.1-nano-2025-04-14
gpt-4.1-nano-2025-04-14
openai美国网关84
12.9 tok/s
吞吐 / 延迟
探测OR快照
查看佐证
7qwen3.5:4b
qwen3.5:4b
qwen中国网关82
12 tok/s
吞吐 / 延迟
探测
查看佐证
8grok-3
grok-3
xai美国网关80
11.1 tok/s
吞吐 / 延迟
探测
查看佐证
9grok-4.20-fast
grok-4.20-fast
xai美国网关80
9.4 tok/s
吞吐 / 延迟
实测
查看佐证
10gpt-5.4-mini
gpt-5.4-mini
openai美国网关71
8.6 tok/s
吞吐 / 延迟
探测AAOR
查看佐证
11gemini-3-5-flash-low
gemini-3-5-flash-low
google美国网关70
8.5 tok/s
吞吐 / 延迟
探测OR快照
查看佐证
12qwen3.6:27b
qwen3.6:27b
qwen中国网关70
54 tok/s
吞吐 / 延迟
探测AAOR
查看佐证
13grok-4.20-0309-reasoning-console
grok-4.20-0309-reasoning-console
x-ai美国网关67
6.3 tok/s
吞吐 / 延迟
实测OR
查看佐证
14grok-4.20-multi-agent-console
grok-4.20-multi-agent-console
x-ai美国网关65
6.1 tok/s
吞吐 / 延迟
实测OR
查看佐证
15grok-4.3-medium
grok-4.3-medium
xai美国网关65
6.1 tok/s
吞吐 / 延迟
实测OR快照Arena
查看佐证
16gpt-4.1-nano
gpt-4.1-nano
openai美国网关64
7.4 tok/s
吞吐 / 延迟
探测AAOR
查看佐证
17gpt-5.6-luna
gpt-5.6-luna
openai美国网关64
184 tok/s
吞吐 / 延迟
探测AAOR
查看佐证
18grok-4.3-high
grok-4.3-high
xai美国网关64
5.9 tok/s
吞吐 / 延迟
实测OR快照Arena
查看佐证
19lingsi1.0
lingsi1.0
other网关64
7.3 tok/s
吞吐 / 延迟
探测
查看佐证
20grok-4.20-0309-console
grok-4.20-0309-console
xai美国网关60
5.5 tok/s
吞吐 / 延迟
实测
查看佐证
21grok-4.3-low
grok-4.3-low
xai美国网关58
5.3 tok/s
吞吐 / 延迟
实测OR快照Arena
查看佐证
22grok-4.20-multi-agent-high
grok-4.20-multi-agent-high
x-ai美国网关55
5 tok/s
吞吐 / 延迟
实测OR
查看佐证
23grok-composer-2.5-fast
grok-composer-2.5-fast
xai美国网关51
5.7 tok/s
吞吐 / 延迟
探测
查看佐证
24GPT-5.6 Luna (max)
aa/gpt-5.6-luna-max
OpenAI美国46
184 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
25GPT-5.6 Luna (xhigh)
aa/gpt-5.6-luna-xhigh
OpenAI美国46
184 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
26grok-4.3-console
grok-4.3-console
xai美国网关46
4.3 tok/s
吞吐 / 延迟
实测OR快照Arena
查看佐证
27GPT-5.6 Luna (low)
aa/gpt-5.6-luna-low
OpenAI美国44
174 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
28grok-4.5
grok-4.5
x-ai美国网关44
58 tok/s
吞吐 / 延迟
探测AAOR
查看佐证
29GPT-5.6 Luna (high)
aa/gpt-5.6-luna-high
OpenAI美国42
166 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
30grok-4.20-multi-agent-medium
grok-4.20-multi-agent-medium
x-ai美国网关42
4 tok/s
吞吐 / 延迟
实测OR
查看佐证
31GPT-5.6 Luna (medium)
aa/gpt-5.6-luna-medium
OpenAI美国41
164 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
32grok-4.20-multi-agent-xhigh
grok-4.20-multi-agent-xhigh
x-ai美国网关39
3.8 tok/s
吞吐 / 延迟
实测OR
查看佐证
33GPT-5.6 Terra (max)
aa/gpt-5.6-terra-max
OpenAI美国33
132 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
34grok-4.3
grok-4.3
x-ai美国网关33
4.4 tok/s
吞吐 / 延迟
探测AAOR
查看佐证
35Muse Spark 1.1 (xhigh)
aa/muse-spark-1.1-xhigh
Meta美国32
127 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
36grok-build-0.1
grok-build-0.1
x-ai美国网关31
4.3 tok/s
吞吐 / 延迟
探测AAOR
查看佐证
37Agnes 2.5 Pro Alpha
aa/agnes-2.5-pro-alpha
Sapiens AI29
116 tok/s
吞吐 / 延迟
AA快照站外对照
查看佐证
38DeepSeek V4 Flash (max)
aa/deepseek-v4-flash-max
DeepSeek中国29
115 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
39GLM-5.2 (max)
aa/glm-5.2-max
Z AI中国29
116 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
40GPT-5.6 Terra (xhigh)
aa/gpt-5.6-terra-xhigh
OpenAI美国28
113 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
41GPT-5.6 Terra (Non-reasoning)
aa/gpt-5.6-terra-non-reasoning
OpenAI美国27
106 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
42GPT-5.6 Terra (high)
aa/gpt-5.6-terra-high
OpenAI美国26
104 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
43GPT-5.6 Terra (medium)
aa/gpt-5.6-terra-medium
OpenAI美国26
104 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
44GPT-5.6 Terra (low)
aa/gpt-5.6-terra-low
OpenAI美国25
99 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
45Claude 4.5 Haiku
aa/claude-4.5-haiku
Anthropic美国24
97 tok/s
吞吐 / 延迟
AA快照站外对照
查看佐证
46composer-2.5
composer-2.5
cursor网关24
3.9 tok/s
吞吐 / 延迟
探测
查看佐证
47Claude Sonnet 5 (max)
aa/claude-sonnet-5-max
Anthropic美国19
75 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
48gpt-5.4
gpt-5.4
openai美国网关17
3.6 tok/s
吞吐 / 延迟
探测AAOR
查看佐证
49GPT-5.6 Sol (max)
aa/gpt-5.6-sol-max
OpenAI美国17
66 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
50Hy3
aa/hy3
Tencent中国17
68 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
51Claude Fable 5 (with fallback)
aa/claude-fable-5-with-fallback
Anthropic美国16
64 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
52Claude Sonnet 5 (Non-reasoning)
aa/claude-sonnet-5-non-reasoning
Anthropic美国16
65 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
53DeepSeek V4 Pro (max)
aa/deepseek-v4-pro-max
DeepSeek中国16
64 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
54deepseek-v4-pro
deepseek-v4-pro
deepseek中国网关16
64 tok/s
吞吐 / 延迟
探测AAOR
查看佐证
55DeepSeek V4 Pro (high)
aa/deepseek-v4-pro-high
DeepSeek中国15
59 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
56GPT-5.6 Sol (high)
aa/gpt-5.6-sol-high
OpenAI美国15
60 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
57GPT-5.6 Sol (xhigh)
aa/gpt-5.6-sol-xhigh
OpenAI美国15
61 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
58Grok 4.5 (high)
aa/grok-4.5-high
xAI美国15
58 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
59Claude Opus 5 (low)
aa/claude-opus-5-low
Anthropic美国14
54 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
60Claude Opus 5 (max)
aa/claude-opus-5-max
Anthropic美国14
54 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
61Claude Opus 5 (xhigh)
aa/claude-opus-5-xhigh
Anthropic美国14
54 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
62GPT-5.6 Sol (low)
aa/gpt-5.6-sol-low
OpenAI美国14
57 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
63GPT-5.6 Sol (medium)
aa/gpt-5.6-sol-medium
OpenAI美国14
55 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
64gpt-5.6-terra
gpt-5.6-terra
openai美国网关14
132 tok/s
吞吐 / 延迟
探测AAOR
查看佐证
65Claude Opus 5 (high)
aa/claude-opus-5-high
Anthropic美国13
53 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
66Claude Opus 5 (medium)
aa/claude-opus-5-medium
Anthropic美国13
53 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
67deepseek-v4-flash
deepseek-v4-flash
deepseek中国网关13
3.5 tok/s
吞吐 / 延迟
探测OR快照OR
查看佐证
68GPT-5.6 Sol (Non-reasoning)
aa/gpt-5.6-sol-non-reasoning
OpenAI美国13
52 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
69codex-auto-review
codex-auto-review
openai美国网关12
2.1 tok/s
吞吐 / 延迟
探测
查看佐证
70gemma4:12b
gemma4:12b
google美国12
35 tok/s
吞吐 / 延迟
探测AA快照
查看佐证
71gemma4:26b-a4b
gemma4:26b-a4b
google美国12
35 tok/s
吞吐 / 延迟
探测AA快照
查看佐证
72gpt-5.2
gpt-5.2
openai美国网关12
2.3 tok/s
吞吐 / 延迟
探测OR快照OR
查看佐证
73gpt-5.2-2025-12-11
gpt-5.2-2025-12-11
openai美国网关12
2 tok/s
吞吐 / 延迟
探测OR快照
查看佐证
74gpt-5.2-chat-latest
gpt-5.2-chat-latest
openai美国网关12
2.3 tok/s
吞吐 / 延迟
探测OR快照
查看佐证
75gpt-5.2-pro
gpt-5.2-pro
openai美国网关12
2.3 tok/s
吞吐 / 延迟
探测OR快照OR
查看佐证
76gpt-5.2-pro-2025-12-11
gpt-5.2-pro-2025-12-11
openai美国网关12
2.3 tok/s
吞吐 / 延迟
探测OR快照
查看佐证
77gpt-5.3-codex-spark
gpt-5.3-codex-spark
openai美国网关12
2.3 tok/s
吞吐 / 延迟
探测OR快照
查看佐证
78gpt-5.4-2026-03-05
gpt-5.4-2026-03-05
openai美国网关12
0.2 tok/s
吞吐 / 延迟
探测OR快照Arena
查看佐证
79gpt-5.5
gpt-5.5
openai美国网关12
0.4 tok/s
吞吐 / 延迟
探测AAOR
查看佐证
80gpt-5.6-sol
gpt-5.6-sol
openai美国网关12
66 tok/s
吞吐 / 延迟
探测AAOR
查看佐证
81Kimi K3 (low)
aa/kimi-k3-low
Kimi中国12
33 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
82Kimi K3 (max)
aa/kimi-k3-max
Kimi中国12
35 tok/s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
83LongCat 2.0
aa/longcat-2.0
LongCat12
43 tok/s
吞吐 / 延迟
AA快照站外对照
查看佐证
84Claude Sonnet 4.6 (Non-reasoning, Low Effort)
aa/claude-sonnet-4.6-non-reasoning-low-effort
Anthropic美国0
42.00s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
85Gemini 3.5 Flash (medium)
aa/gemini-3.5-flash-medium
Google美国0
153.00s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
86Gemini 3.5 Flash (minimal)
aa/gemini-3.5-flash-minimal
Google美国0
153.00s
吞吐 / 延迟
AA快照站外对照Arena
查看佐证
87GPT-5.3 Codex (xhigh)
aa/gpt-5.3-codex-xhigh
OpenAI美国0
114.00s
吞吐 / 延迟
AA快照站外对照
查看佐证
88o3
aa/o3
OpenAI美国0
115.00s
吞吐 / 延迟
AA快照站外对照
查看佐证
89Qwen3.5 Omni Plus
aa/qwen3.5-omni-plus
Alibaba中国0
54.00s
吞吐 / 延迟
AA快照站外对照
查看佐证

启发式维度(中文/英文/OCR/软件等)在无官方公开 bench 时由厂商归属、模态与关联模型热度估算,仅供选型参考; 客观能力以 AA 智力/代码/Agent 与本站实测为准。交叉验证: 用量榜 · 模型目录 · 实验室

GrokCode 推理速度天梯 | AI模型速度排名与对比 · GrokCode 倍率榜