模型智能能力 · 多维天梯

图像处理

评估模型在图像理解、分析、生成与编辑上的综合能力

数据更新于 2026-07-31 · 能力库 206 条(网关 49 · 站外 157 · AA 173 · Arena 100 · 当前榜 85 · OpenRouter 实时已接入 · 知识库 159 模 / 31 族 / 26 维

图像处理 配图

模型天梯 · modality

图像处理

本榜单聚焦AI模型图像处理能力,覆盖视觉问答、图像描述、OCR识别、图表/文档理解、图像生成与编辑等任务。数据来源于LMSYS Chatbot Arena视觉赛道、MMMU、VLMEvalKit、AI2D等公开基准,结合API实际调用量统计与启发式规则(如分辨率支持、推理速度)。分数通过加权平均计算,突出准确率、鲁棒性与多任务泛化。解读时需结合具体任务场景,注意基准可能存在的训练数据污染与模型视觉token限制差异。

  • 基准准确率加权(MMMU、VQAv2等核心指标)
  • Arena人类偏好投票与盲测胜率
  • 实际用量与响应质量启发式评分
显示 85全量 85

列表 85 / 85(全库 85)· 点击「佐证」查看评分依据与测试题面

🥈
gpt-5.6-sol
openai · 美国
77 图像理解
🥉
gpt-5.5
openai · 美国
74 图像理解
#模型厂商地区图像理解相对说明证据源佐证
🥇Claude Fable 5 (High)
arena/claude-fable-5-high
Anthropic美国77
视觉理解
图像输入多模态
Arena站外对照
查看佐证
🥈gpt-5.6-sol
gpt-5.6-sol
openai美国网关77
视觉理解
图像输入多模态
探测AAOR
查看佐证
🥉gpt-5.5
gpt-5.5
openai美国网关74
视觉理解
图像输入多模态
探测AAOR
查看佐证
4grok-4.5
grok-4.5
x-ai美国网关73
视觉理解
图像输入多模态
探测AAOR
查看佐证
5gpt-5.4
gpt-5.4
openai美国网关72
视觉理解
图像输入多模态
探测AAOR
查看佐证
6Claude Opus 4.8 (Thinking)
arena/claude-opus-4.8-thinking
Anthropic美国67
视觉理解
图像输入多模态
Arena站外对照
查看佐证
7Claude Opus 5
anthropic/claude-opus-5
anthropic美国65
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
8Claude Fable 5
anthropic/claude-fable-5
anthropic美国64
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
9Claude Sonnet 5 (High)
arena/claude-sonnet-5-high
Anthropic美国64
视觉理解
图像输入多模态
Arena站外对照
查看佐证
10Gemini 3 Flash
arena/gemini-3-flash
Google美国64
视觉理解
图像输入多模态
Arena站外对照
查看佐证
11gpt-5.4-mini
gpt-5.4-mini
openai美国网关63
视觉理解
图像输入多模态
探测AAOR
查看佐证
12Claude Opus 4.7 (Thinking)
arena/claude-opus-4.7-thinking
Anthropic美国62
视觉理解
图像输入多模态
Arena站外对照
查看佐证
13Kimi K3
moonshotai/kimi-k3
moonshotai中国62
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
14grok-build-0.1
grok-build-0.1
x-ai美国网关61
视觉理解
图像输入多模态
探测AAOR
查看佐证
15Claude Opus 4.8
anthropic/claude-opus-4.8
anthropic美国60
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
16Claude Opus 5 (max)
aa/claude-opus-5-max
Anthropic美国60
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
17gpt-5.6-terra
gpt-5.6-terra
openai美国网关60
视觉理解
图像输入多模态
探测AAOR
查看佐证
18Claude Fable 5 (with fallback)
aa/claude-fable-5-with-fallback
Anthropic美国59
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
19Claude Opus 4.7
anthropic/claude-opus-4.7
anthropic美国59
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
20Claude Opus 5 (xhigh)
aa/claude-opus-5-xhigh
Anthropic美国59
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
21Claude Opus 5 (high)
aa/claude-opus-5-high
Anthropic美国58
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
22Claude Sonnet 5
anthropic/claude-sonnet-5
anthropic美国58
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
23grok-4.3
grok-4.3
x-ai美国网关58
视觉理解
图像输入多模态
探测AAOR
查看佐证
24gpt-5.6-luna
gpt-5.6-luna
openai美国网关57
视觉理解
图像输入多模态
探测AAOR
查看佐证
25Claude Opus 4.6
arena/claude-opus-4.6
Anthropic美国56
视觉理解
图像输入多模态
Arena站外对照
查看佐证
26Gemini 3.5 Flash
google/gemini-3.5-flash
google美国56
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
27gemini-3-5-flash-low
gemini-3-5-flash-low
google美国网关56
视觉理解
图像输入多模态
探测OR快照
查看佐证
28Muse Spark 1.1
meta/muse-spark-1.1
meta美国56
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
29Claude Opus 5 (medium)
aa/claude-opus-5-medium
Anthropic美国55
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
30Gemini 3.6 Flash
google/gemini-3.6-flash
google美国55
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
31Claude Sonnet 5 (max)
aa/claude-sonnet-5-max
Anthropic美国52
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
32Gemini 3.1 Pro Preview
google/gemini-3.1-pro-preview
google美国52
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
33Claude Sonnet 4.6
anthropic/claude-sonnet-4.6
anthropic美国51
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
34Claude Opus 5 (low)
aa/claude-opus-5-low
Anthropic美国50
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
35Kimi K2.6
moonshotai/kimi-k2.6
moonshotai中国49
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
36MiniMax M3
minimax/minimax-m3
minimax中国48
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
37Kimi K2.7 Code
moonshotai/kimi-k2.7-code
moonshotai中国47
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
38Nex-N2-Pro
nex-agi/nex-n2-pro
nex-agi46
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
39Gemini 3.5 Flash (medium)
aa/gemini-3.5-flash-medium
Google美国44
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
40Inkling
thinkingmachines/inkling
thinkingmachines44
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
41Qwen3.6 Plus
qwen/qwen3.6-plus
qwen中国44
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
42GPT-5.4 Nano
openai/gpt-5.4-nano
openai美国43
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
43Inkling Small
thinkingmachines/inkling-small
thinkingmachines43
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
44Qwen3.7 Plus
qwen/qwen3.7-plus
qwen中国43
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
45MiMo-V2.5
xiaomi/mimo-v2.5
xiaomi中国42
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
46Claude Sonnet 4.5
anthropic/claude-sonnet-4.5
anthropic美国41
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
47Claude Sonnet 5 (Non-reasoning)
aa/claude-sonnet-5-non-reasoning
Anthropic美国41
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
48Gemini 3.5 Flash Lite
google/gemini-3.5-flash-lite
google美国40
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
49GPT-5.1
openai/gpt-5.1
openai美国40
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
50Kimi K2.5
moonshotai/kimi-k2.5
moonshotai中国38
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
51Qwen3.5 397B A17B
qwen/qwen3.5-397b-a17b
qwen中国38
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
52gpt-4.1-nano
gpt-4.1-nano
openai美国网关37
视觉理解
图像输入多模态
探测AAOR
查看佐证
53Gemini 3.5 Flash (High)
arena/gemini-3.5-flash-high
Google美国36
视觉理解
图像输入多模态
Arena站外对照
查看佐证
54Qwen3.5-122B-A10B
qwen/qwen3.5-122b-a10b
qwen中国36
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
55GPT-5
openai/gpt-5
openai美国35
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
56Gemini 3.5 Flash (minimal)
aa/gemini-3.5-flash-minimal
Google美国34
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
57Mistral Medium 3.5
mistralai/mistral-medium-3-5
mistralai其他34
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
58Claude Haiku 4.5
anthropic/claude-haiku-4.5
anthropic美国33
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
59Claude Sonnet 4.6 (Non-reasoning, Low Effort)
aa/claude-sonnet-4.6-non-reasoning-low-effort
Anthropic美国33
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
60Gemma 4 31B
google/gemma-4-31b-it
google美国33
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
61Gemma 4 31B (free)
google/gemma-4-31b-it:free
google美国33
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
62Step 3.7 Flash
stepfun/step-3.7-flash
stepfun中国33
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
63Claude Sonnet 4
anthropic/claude-sonnet-4
anthropic美国31
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
64Claude 4.5 Haiku
aa/claude-4.5-haiku
Anthropic美国30
视觉理解
图像输入多模态
AA快照站外对照
查看佐证
65o3
aa/o3
OpenAI美国30
视觉理解
图像输入多模态
AA快照站外对照
查看佐证
66Gemma 4 26B A4B (free)
google/gemma-4-26b-a4b-it:free
google美国29
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
67Gemini 2.5 Pro
google/gemini-2.5-pro
google美国28
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
68Gemini 3.1 Flash Lite Preview
google/gemini-3.1-flash-lite-preview
google美国28
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
69Qwen3.5-35B-A3B
qwen/qwen3.5-35b-a3b
qwen中国28
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
70gpt-5.2
gpt-5.2
openai美国网关25
视觉理解
图像输入多模态
探测OR快照OR
查看佐证
71gpt-5.2-pro
gpt-5.2-pro
openai美国网关25
视觉理解
图像输入多模态
探测OR快照OR
查看佐证
72Qwen3.5-9B
qwen/qwen3.5-9b
qwen中国23
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
73GPT-5 Mini
openai/gpt-5-mini
openai美国22
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
74Mistral Small 4
mistralai/mistral-small-2603
mistralai其他22
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
75Nova 2 Lite
amazon/nova-2-lite-v1
amazon美国19
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
76Mistral Large 3 2512
mistralai/mistral-large-2512
mistralai其他17
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
77GPT-4.1 Mini
openai/gpt-4.1-mini
openai美国16
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
78Mistral Medium 3.1
mistralai/mistral-medium-3.1
mistralai其他16
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
79Llama 4 Maverick
meta-llama/llama-4-maverick
meta-llama美国15
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
80Ministral 3 14B 2512
mistralai/ministral-14b-2512
mistralai其他12
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
81Llama 4 Scout
meta-llama/llama-4-scout
meta-llama美国9
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
82Ministral 3 8B 2512
mistralai/ministral-8b-2512
mistralai其他9
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
83Gemma 3 27B
google/gemma-3-27b-it
google美国8
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
84Ministral 3 3B 2512
mistralai/ministral-3b-2512
mistralai其他6
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
85Gemma 3 12B
google/gemma-3-12b-it
google美国5
视觉理解
图像输入多模态
AAOR站外对照
查看佐证

启发式维度(中文/英文/OCR/软件等)在无官方公开 bench 时由厂商归属、模态与关联模型热度估算,仅供选型参考; 客观能力以 AA 智力/代码/Agent 与本站实测为准。交叉验证: 用量榜 · 模型目录 · 实验室

图像处理天梯 - GrokCode模型排行榜 · GrokCode 倍率榜