图像处理
评估模型在图像理解、分析、生成与编辑上的综合能力
数据更新于 2026-07-31 · 能力库 206 条(网关 49 · 站外 157 · AA 173 · Arena 100) · 当前榜 85 名 · OpenRouter 实时已接入 · 知识库 159 模 / 31 族 / 26 维

模型天梯 · modality
图像处理
本榜单聚焦AI模型图像处理能力,覆盖视觉问答、图像描述、OCR识别、图表/文档理解、图像生成与编辑等任务。数据来源于LMSYS Chatbot Arena视觉赛道、MMMU、VLMEvalKit、AI2D等公开基准,结合API实际调用量统计与启发式规则(如分辨率支持、推理速度)。分数通过加权平均计算,突出准确率、鲁棒性与多任务泛化。解读时需结合具体任务场景,注意基准可能存在的训练数据污染与模型视觉token限制差异。
- 基准准确率加权(MMMU、VQAv2等核心指标)
- Arena人类偏好投票与盲测胜率
- 实际用量与响应质量启发式评分
| # | 模型 | 厂商 | 地区 | 图像理解 | 相对 | 说明 | 证据源 | 佐证 |
|---|---|---|---|---|---|---|---|---|
| 🥇 | Claude Fable 5 (High) arena/claude-fable-5-high | Anthropic | 美国 | 77 | 视觉理解 图像输入多模态 | Arena站外对照 | 查看佐证 | |
| 🥈 | gpt-5.6-sol gpt-5.6-sol | openai | 美国网关 | 77 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 🥉 | gpt-5.5 gpt-5.5 | openai | 美国网关 | 74 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 4 | grok-4.5 grok-4.5 | x-ai | 美国网关 | 73 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 5 | gpt-5.4 gpt-5.4 | openai | 美国网关 | 72 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 6 | Claude Opus 4.8 (Thinking) arena/claude-opus-4.8-thinking | Anthropic | 美国 | 67 | 视觉理解 图像输入多模态 | Arena站外对照 | 查看佐证 | |
| 7 | Claude Opus 5 anthropic/claude-opus-5 | anthropic | 美国 | 65 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 8 | Claude Fable 5 anthropic/claude-fable-5 | anthropic | 美国 | 64 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 9 | Claude Sonnet 5 (High) arena/claude-sonnet-5-high | Anthropic | 美国 | 64 | 视觉理解 图像输入多模态 | Arena站外对照 | 查看佐证 | |
| 10 | Gemini 3 Flash arena/gemini-3-flash | 美国 | 64 | 视觉理解 图像输入多模态 | Arena站外对照 | 查看佐证 | ||
| 11 | gpt-5.4-mini gpt-5.4-mini | openai | 美国网关 | 63 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 12 | Claude Opus 4.7 (Thinking) arena/claude-opus-4.7-thinking | Anthropic | 美国 | 62 | 视觉理解 图像输入多模态 | Arena站外对照 | 查看佐证 | |
| 13 | Kimi K3 moonshotai/kimi-k3 | moonshotai | 中国 | 62 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 14 | grok-build-0.1 grok-build-0.1 | x-ai | 美国网关 | 61 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 15 | Claude Opus 4.8 anthropic/claude-opus-4.8 | anthropic | 美国 | 60 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 16 | Claude Opus 5 (max) aa/claude-opus-5-max | Anthropic | 美国 | 60 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 17 | gpt-5.6-terra gpt-5.6-terra | openai | 美国网关 | 60 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 18 | Claude Fable 5 (with fallback) aa/claude-fable-5-with-fallback | Anthropic | 美国 | 59 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 19 | Claude Opus 4.7 anthropic/claude-opus-4.7 | anthropic | 美国 | 59 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 20 | Claude Opus 5 (xhigh) aa/claude-opus-5-xhigh | Anthropic | 美国 | 59 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 21 | Claude Opus 5 (high) aa/claude-opus-5-high | Anthropic | 美国 | 58 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 22 | Claude Sonnet 5 anthropic/claude-sonnet-5 | anthropic | 美国 | 58 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 23 | grok-4.3 grok-4.3 | x-ai | 美国网关 | 58 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 24 | gpt-5.6-luna gpt-5.6-luna | openai | 美国网关 | 57 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 25 | Claude Opus 4.6 arena/claude-opus-4.6 | Anthropic | 美国 | 56 | 视觉理解 图像输入多模态 | Arena站外对照 | 查看佐证 | |
| 26 | Gemini 3.5 Flash google/gemini-3.5-flash | 美国 | 56 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 27 | gemini-3-5-flash-low gemini-3-5-flash-low | 美国网关 | 56 | 视觉理解 图像输入多模态 | 探测OR快照 | 查看佐证 | ||
| 28 | Muse Spark 1.1 meta/muse-spark-1.1 | meta | 美国 | 56 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 29 | Claude Opus 5 (medium) aa/claude-opus-5-medium | Anthropic | 美国 | 55 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 30 | Gemini 3.6 Flash google/gemini-3.6-flash | 美国 | 55 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 31 | Claude Sonnet 5 (max) aa/claude-sonnet-5-max | Anthropic | 美国 | 52 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 32 | Gemini 3.1 Pro Preview google/gemini-3.1-pro-preview | 美国 | 52 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 33 | Claude Sonnet 4.6 anthropic/claude-sonnet-4.6 | anthropic | 美国 | 51 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 34 | Claude Opus 5 (low) aa/claude-opus-5-low | Anthropic | 美国 | 50 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 35 | Kimi K2.6 moonshotai/kimi-k2.6 | moonshotai | 中国 | 49 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 36 | MiniMax M3 minimax/minimax-m3 | minimax | 中国 | 48 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 37 | Kimi K2.7 Code moonshotai/kimi-k2.7-code | moonshotai | 中国 | 47 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 38 | Nex-N2-Pro nex-agi/nex-n2-pro | nex-agi | — | 46 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 39 | Gemini 3.5 Flash (medium) aa/gemini-3.5-flash-medium | 美国 | 44 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | ||
| 40 | Inkling thinkingmachines/inkling | thinkingmachines | — | 44 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 41 | Qwen3.6 Plus qwen/qwen3.6-plus | qwen | 中国 | 44 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 42 | GPT-5.4 Nano openai/gpt-5.4-nano | openai | 美国 | 43 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 43 | Inkling Small thinkingmachines/inkling-small | thinkingmachines | — | 43 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 44 | Qwen3.7 Plus qwen/qwen3.7-plus | qwen | 中国 | 43 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 45 | MiMo-V2.5 xiaomi/mimo-v2.5 | xiaomi | 中国 | 42 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 46 | Claude Sonnet 4.5 anthropic/claude-sonnet-4.5 | anthropic | 美国 | 41 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 47 | Claude Sonnet 5 (Non-reasoning) aa/claude-sonnet-5-non-reasoning | Anthropic | 美国 | 41 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 48 | Gemini 3.5 Flash Lite google/gemini-3.5-flash-lite | 美国 | 40 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 49 | GPT-5.1 openai/gpt-5.1 | openai | 美国 | 40 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 50 | Kimi K2.5 moonshotai/kimi-k2.5 | moonshotai | 中国 | 38 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 51 | Qwen3.5 397B A17B qwen/qwen3.5-397b-a17b | qwen | 中国 | 38 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 52 | gpt-4.1-nano gpt-4.1-nano | openai | 美国网关 | 37 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 53 | Gemini 3.5 Flash (High) arena/gemini-3.5-flash-high | 美国 | 36 | 视觉理解 图像输入多模态 | Arena站外对照 | 查看佐证 | ||
| 54 | Qwen3.5-122B-A10B qwen/qwen3.5-122b-a10b | qwen | 中国 | 36 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 55 | GPT-5 openai/gpt-5 | openai | 美国 | 35 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 56 | Gemini 3.5 Flash (minimal) aa/gemini-3.5-flash-minimal | 美国 | 34 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | ||
| 57 | Mistral Medium 3.5 mistralai/mistral-medium-3-5 | mistralai | 其他 | 34 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 58 | Claude Haiku 4.5 anthropic/claude-haiku-4.5 | anthropic | 美国 | 33 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 59 | Claude Sonnet 4.6 (Non-reasoning, Low Effort) aa/claude-sonnet-4.6-non-reasoning-low-effort | Anthropic | 美国 | 33 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 60 | Gemma 4 31B google/gemma-4-31b-it | 美国 | 33 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 61 | Gemma 4 31B (free) google/gemma-4-31b-it:free | 美国 | 33 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 62 | Step 3.7 Flash stepfun/step-3.7-flash | stepfun | 中国 | 33 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 63 | Claude Sonnet 4 anthropic/claude-sonnet-4 | anthropic | 美国 | 31 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 64 | Claude 4.5 Haiku aa/claude-4.5-haiku | Anthropic | 美国 | 30 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 65 | o3 aa/o3 | OpenAI | 美国 | 30 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 66 | Gemma 4 26B A4B (free) google/gemma-4-26b-a4b-it:free | 美国 | 29 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 67 | Gemini 2.5 Pro google/gemini-2.5-pro | 美国 | 28 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 68 | Gemini 3.1 Flash Lite Preview google/gemini-3.1-flash-lite-preview | 美国 | 28 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 69 | Qwen3.5-35B-A3B qwen/qwen3.5-35b-a3b | qwen | 中国 | 28 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 70 | gpt-5.2 gpt-5.2 | openai | 美国网关 | 25 | 视觉理解 图像输入多模态 | 探测OR快照OR | 查看佐证 | |
| 71 | gpt-5.2-pro gpt-5.2-pro | openai | 美国网关 | 25 | 视觉理解 图像输入多模态 | 探测OR快照OR | 查看佐证 | |
| 72 | Qwen3.5-9B qwen/qwen3.5-9b | qwen | 中国 | 23 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 73 | GPT-5 Mini openai/gpt-5-mini | openai | 美国 | 22 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 74 | Mistral Small 4 mistralai/mistral-small-2603 | mistralai | 其他 | 22 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 75 | Nova 2 Lite amazon/nova-2-lite-v1 | amazon | 美国 | 19 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 76 | Mistral Large 3 2512 mistralai/mistral-large-2512 | mistralai | 其他 | 17 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 77 | GPT-4.1 Mini openai/gpt-4.1-mini | openai | 美国 | 16 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 78 | Mistral Medium 3.1 mistralai/mistral-medium-3.1 | mistralai | 其他 | 16 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 79 | Llama 4 Maverick meta-llama/llama-4-maverick | meta-llama | 美国 | 15 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 80 | Ministral 3 14B 2512 mistralai/ministral-14b-2512 | mistralai | 其他 | 12 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 81 | Llama 4 Scout meta-llama/llama-4-scout | meta-llama | 美国 | 9 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 82 | Ministral 3 8B 2512 mistralai/ministral-8b-2512 | mistralai | 其他 | 9 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 83 | Gemma 3 27B google/gemma-3-27b-it | 美国 | 8 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 84 | Ministral 3 3B 2512 mistralai/ministral-3b-2512 | mistralai | 其他 | 6 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 85 | Gemma 3 12B google/gemma-3-12b-it | 美国 | 5 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 |
启发式维度(中文/英文/OCR/软件等)在无官方公开 bench 时由厂商归属、模态与关联模型热度估算,仅供选型参考; 客观能力以 AA 智力/代码/Agent 与本站实测为准。交叉验证: 用量榜 · 模型目录 · 实验室。
Related tools
Clavue CLI / imux IDE / clavue-2.1
Clavue · CLI 与 Agent 平台
CLI / GUI Agent 运行时、设备登录、会员额度与 OpenAI 兼容 API(api.clavue.com)。开发脚本、CI 与本地工具一条链路。
打开 Clavue ↗imux · 原生 macOS AI IDE
Clavue 平台的原生 IDE:多 Agent 分屏、Ghostty 级终端、Agent Chat、浏览器自动化与 Supervisor——不是又一个 Electron 壳。
了解 imux ↗Clavue 2.1 · 产品级大模型
旗舰模型 clavue-2.1(及 fast / pro / rev):适合复杂推理与长程 Agent 循环。Chat、imux、API 共用会员额度。
查看模型 ↗