模型智能能力 · 多维天梯

图像处理

评估模型在图像理解、分析、生成与编辑上的综合能力

数据更新于 2026-08-03 · 能力库 351 条(网关 49 · 站外 302 · AA 311 · Arena 122 · 当前榜 94 · OpenRouter 实时已接入 · 知识库 161 模 / 36 族 / 26 维

公榜(客观 AA · 开源/闭源分榜)与 私榜(实测/用量/中国大模型)均为独立 SEO URL;日更快照 + ISR。 公榜总览 → · 私榜总览 → · 开源 · 闭源

图像处理 配图

模型天梯 · modality

图像处理

本榜单聚焦AI模型图像处理能力,覆盖视觉问答、图像描述、OCR识别、图表/文档理解、图像生成与编辑等任务。数据来源于LMSYS Chatbot Arena视觉赛道、MMMU、VLMEvalKit、AI2D等公开基准,结合API实际调用量统计与启发式规则(如分辨率支持、推理速度)。分数通过加权平均计算,突出准确率、鲁棒性与多任务泛化。解读时需结合具体任务场景,注意基准可能存在的训练数据污染与模型视觉token限制差异。

  • 基准准确率加权(MMMU、VQAv2等核心指标)
  • Arena人类偏好投票与盲测胜率
  • 实际用量与响应质量启发式评分
显示 94全量 94

列表 94 / 94(全库 94)· 点击「佐证」查看评分依据与测试题面

#模型厂商地区图像理解相对说明证据源佐证
🥇Claude Opus 5 (max)
aa/claude-opus-5-max
Anthropic美国61
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
🥈Claude Fable 5 (with fallback)
aa/claude-fable-5-with-fallback
Anthropic美国60
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
🥉Claude Opus 5 (xhigh)
aa/claude-opus-5-xhigh
Anthropic美国60
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
4Claude Opus 5 (high)
aa/claude-opus-5-high
Anthropic美国59
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
5Claude Opus 5 (medium)
aa/claude-opus-5-medium
Anthropic美国56
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
6Claude Fable 5.1
anthropic/claude-fable-5.1
anthropic美国53
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
7Claude Sonnet 5 (max)
aa/claude-sonnet-5-max
Anthropic美国53
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
8GPT-6 Astra
openai/gpt-6-astra
openai美国53
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
9gpt-5.4
gpt-5.4
openai美国网关51
视觉理解
图像输入多模态
探测OR快照OR
查看佐证
10Claude Opus 5 (low)
aa/claude-opus-5-low
Anthropic美国51
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
11Claude Opus 5
anthropic/claude-opus-5
anthropic美国51
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
12Claude Fable 5
anthropic/claude-fable-5
anthropic美国50
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
13GPT-5.6 Sol (batch)
openai/gpt-5.6-sol:batch
openai美国47
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
14gpt-5.6-sol
gpt-5.6-sol
openai美国网关47
视觉理解
图像输入多模态
探测AAOR
查看佐证
15Gemini 3.5 Flash (medium)
aa/gemini-3.5-flash-medium
Google美国45
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
16Grok 4.6
x-ai/grok-4.6
x-ai美国44
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
17Kimi K3
moonshotai/kimi-k3
moonshotai中国44
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
18GPT-5.6 Terra (batch)
openai/gpt-5.6-terra:batch
openai美国42
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
19gpt-5.6-terra
gpt-5.6-terra
openai美国网关42
视觉理解
图像输入多模态
探测AAOR
查看佐证
20Claude Opus 4.8
anthropic/claude-opus-4.8
anthropic美国42
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
21Claude Sonnet 5 (Non-reasoning)
aa/claude-sonnet-5-non-reasoning
Anthropic美国42
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
22GLM 5.3 Flash
z-ai/glm-5.3-flash
z-ai中国42
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
23Gemini 3.8 Flash
google/gemini-3.8-flash
google美国41
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
24Qwen3.8 Max (0902)
qwen/qwen3.8-max-0902
qwen中国40
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
25Qwen3.6 Plus
aa/qwen3.6-plus
Alibaba中国40
视觉理解
图像输入多模态
AA快照站外对照
查看佐证
26grok-build-0.1
grok-build-0.1
x-ai美国网关40
视觉理解
图像输入多模态
探测OR快照OR
查看佐证
27Muse Spark 1.2
meta/muse-spark-1.2
meta美国40
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
28DeepSeek V4.1 Flash
deepseek/deepseek-v4.1-flash
deepseek中国40
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
29Gemini 3.7 Flash
google/gemini-3.7-flash
google美国39
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
30grok-4.5
grok-4.5
x-ai美国网关39
视觉理解
图像输入多模态
探测AAOR
查看佐证
31gpt-5.5
gpt-5.5
openai美国网关39
视觉理解
图像输入多模态
探测AAOR
查看佐证
32GPT-5.5 (batch)
openai/gpt-5.5:batch
openai美国39
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
33Claude Sonnet 5
anthropic/claude-sonnet-5
anthropic美国38
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
34GPT-5.6 Luna (batch)
openai/gpt-5.6-luna:batch
openai美国38
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
35gpt-5.6-luna
gpt-5.6-luna
openai美国网关38
视觉理解
图像输入多模态
探测AAOR
查看佐证
36Gemini 3.5 Flash (minimal)
aa/gemini-3.5-flash-minimal
Google美国35
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
37gpt-5.2
gpt-5.2
openai美国网关35
视觉理解
图像输入多模态
探测OR快照OR
查看佐证
38gpt-5.2-pro
gpt-5.2-pro
openai美国网关35
视觉理解
图像输入多模态
探测OR快照OR
查看佐证
39Gemini 3.6 Flash
google/gemini-3.6-flash
google美国34
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
40Muse Spark 1.1
meta/muse-spark-1.1
meta美国34
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
41Claude Sonnet 4.6 (Non-reasoning, Low Effort)
aa/claude-sonnet-4.6-non-reasoning-low-effort
Anthropic美国34
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
42Qwen3.8 27B
qwen/qwen3.8-27b
qwen中国34
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
43Gemini 3.5 Flash
google/gemini-3.5-flash
google美国33
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
44Claude Sonnet 4.6
anthropic/claude-sonnet-4.6
anthropic美国31
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
45Gemini 3.1 Pro Preview
google/gemini-3.1-pro-preview
google美国30
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
46Claude 4.5 Haiku
aa/claude-4.5-haiku
Anthropic美国30
视觉理解
图像输入多模态
AA快照站外对照
查看佐证
47o3
aa/o3
OpenAI美国30
视觉理解
图像输入多模态
AA快照站外对照
查看佐证
48Step 3.7 Flash
aa/step-3.7-flash
StepFun中国30
视觉理解
图像输入多模态
AA快照站外对照
查看佐证
49gemini-3-5-flash-low
gemini-3-5-flash-low
google美国网关30
视觉理解
图像输入多模态
探测OR快照
查看佐证
50MiniMax M3
minimax/minimax-m3
minimax中国30
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
51Kimi K2.6
moonshotai/kimi-k2.6
moonshotai中国28
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
52Kimi K2.7 Code
moonshotai/kimi-k2.7-code
moonshotai中国26
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
53Inkling Small
thinkingmachines/inkling-small
thinkingmachines26
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
54Inkling Small (free)
thinkingmachines/inkling-small:free
thinkingmachines26
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
55Qwen3.7 Plus
qwen/qwen3.7-plus
qwen中国26
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
56Inkling
thinkingmachines/inkling
thinkingmachines26
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
57Inkling (free)
thinkingmachines/inkling:free
thinkingmachines26
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
58Grok 4.3 (batch)
x-ai/grok-4.3:batch
x-ai美国25
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
59grok-4.3
grok-4.3
x-ai美国网关25
视觉理解
图像输入多模态
探测AAOR
查看佐证
60Gemini 3.1 Flash-Lite
aa/gemini-3.1-flash-lite
Google美国25
视觉理解
图像输入多模态
AA快照站外对照Arena
查看佐证
61Ling 3.0 Flash VL
inclusionai/ling-3.0-flash-vl
inclusionai中国25
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
62Ling 3.0 Flash VL (free)
inclusionai/ling-3.0-flash-vl:free
inclusionai中国25
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
63GPT-5.4 Mini (batch)
openai/gpt-5.4-mini:batch
openai美国25
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
64gpt-5.4-mini
gpt-5.4-mini
openai美国网关25
视觉理解
图像输入多模态
探测AAOR
查看佐证
65Qwen3.5 35B A3B
aa/qwen3.5-35b-a3b
Alibaba中国24
视觉理解
图像输入多模态
AA快照站外对照
查看佐证
66Gemini 3.5 Flash Lite
google/gemini-3.5-flash-lite
google美国23
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
67MiMo-V2.5
xiaomi/mimo-v2.5
xiaomi中国22
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
68Claude Sonnet 4.5
anthropic/claude-sonnet-4.5
anthropic美国21
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
69GPT-5.4 Nano
openai/gpt-5.4-nano
openai美国21
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
70Qwen3.5 9B
aa/qwen3.5-9b
Alibaba中国21
视觉理解
图像输入多模态
AA快照站外对照
查看佐证
71Qwen3.5 397B A17B
qwen/qwen3.5-397b-a17b
qwen中国19
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
72Claude Haiku 4.5
anthropic/claude-haiku-4.5
anthropic美国18
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
73GPT-5 Mini
openai/gpt-5-mini
openai美国17
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
74Gemini 2.5 Pro
google/gemini-2.5-pro
google美国17
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
75Qwen3.5-122B-A10B
qwen/qwen3.5-122b-a10b
qwen中国16
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
76Gemini 3.1 Flash Lite Preview
google/gemini-3.1-flash-lite-preview
google美国16
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
77Gemma 4 31B
google/gemma-4-31b-it
google美国15
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
78Gemma 4 31B (free)
google/gemma-4-31b-it:free
google美国15
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
79Mistral Medium 3.5
mistralai/mistral-medium-3-5
mistralai其他15
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
80Mistral Small 4
mistralai/mistral-small-2603
mistralai其他12
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
81Mistral Large 3 2512
mistralai/mistral-large-2512
mistralai其他10
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
82gpt-4.1-nano
gpt-4.1-nano
openai美国网关10
视觉理解
图像输入多模态
探测OR快照OR
查看佐证
83Llama 4 Maverick
meta-llama/llama-4-maverick
meta-llama美国9
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
84NVIDIA Nemotron Nano 12B v2 VL
aa/nvidia-nemotron-nano-12b-v2-vl
NVIDIA美国9
视觉理解
图像输入多模态
AA快照站外对照
查看佐证
85Step3 VL 10B
aa/step3-vl-10b
StepFun中国9
视觉理解
图像输入多模态
AA快照站外对照
查看佐证
86Llama 4 Scout
meta-llama/llama-4-scout
meta-llama美国7
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
87Llama 3.2 90B (Vision)
aa/llama-3.2-90b-vision
Meta美国6
视觉理解
图像输入多模态
AA快照站外对照
查看佐证
88Ministral 3 14B 2512
mistralai/ministral-14b-2512
mistralai其他6
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
89Ministral 3 8B 2512
mistralai/ministral-8b-2512
mistralai其他6
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
90Gemma 3 27B
google/gemma-3-27b-it
google美国5
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
91Ministral 3 3B 2512
mistralai/ministral-3b-2512
mistralai其他5
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
92Gemma 3 12B
google/gemma-3-12b-it
google美国4
视觉理解
图像输入多模态
AAOR站外对照
查看佐证
93Llama 3.2 11B (Vision)
aa/llama-3.2-11b-vision
Meta美国3
视觉理解
图像输入多模态
AA快照站外对照
查看佐证
94LFM2.5-VL-1.6B
aa/lfm2.5-vl-1.6b
Liquid AI1
视觉理解
图像输入多模态
AA快照站外对照
查看佐证

启发式维度(中文/英文/OCR/软件等)在无官方公开 bench 时由厂商归属、模态与关联模型热度估算,仅供选型参考; 客观能力以 AA 智力/代码/Agent 与本站实测为准。交叉验证: 用量榜 · 模型目录 · 实验室

图像处理天梯 - GrokCode模型排行榜 · GrokCode 倍率榜