图像处理
评估模型在图像理解、分析、生成与编辑上的综合能力
数据更新于 2026-08-03 · 能力库 351 条(网关 49 · 站外 302 · AA 311 · Arena 122) · 当前榜 94 名 · OpenRouter 实时已接入 · 知识库 161 模 / 36 族 / 26 维
公榜(客观 AA · 开源/闭源分榜)与 私榜(实测/用量/中国大模型)均为独立 SEO URL;日更快照 + ISR。 公榜总览 → · 私榜总览 → · 开源 · 闭源

模型天梯 · modality
图像处理
本榜单聚焦AI模型图像处理能力,覆盖视觉问答、图像描述、OCR识别、图表/文档理解、图像生成与编辑等任务。数据来源于LMSYS Chatbot Arena视觉赛道、MMMU、VLMEvalKit、AI2D等公开基准,结合API实际调用量统计与启发式规则(如分辨率支持、推理速度)。分数通过加权平均计算,突出准确率、鲁棒性与多任务泛化。解读时需结合具体任务场景,注意基准可能存在的训练数据污染与模型视觉token限制差异。
- 基准准确率加权(MMMU、VQAv2等核心指标)
- Arena人类偏好投票与盲测胜率
- 实际用量与响应质量启发式评分
| # | 模型 | 厂商 | 地区 | 图像理解 | 相对 | 说明 | 证据源 | 佐证 |
|---|---|---|---|---|---|---|---|---|
| 🥇 | Claude Opus 5 (max) aa/claude-opus-5-max | Anthropic | 美国 | 61 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 🥈 | Claude Fable 5 (with fallback) aa/claude-fable-5-with-fallback | Anthropic | 美国 | 60 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 🥉 | Claude Opus 5 (xhigh) aa/claude-opus-5-xhigh | Anthropic | 美国 | 60 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 4 | Claude Opus 5 (high) aa/claude-opus-5-high | Anthropic | 美国 | 59 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 5 | Claude Opus 5 (medium) aa/claude-opus-5-medium | Anthropic | 美国 | 56 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 6 | Claude Fable 5.1 anthropic/claude-fable-5.1 | anthropic | 美国 | 53 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 7 | Claude Sonnet 5 (max) aa/claude-sonnet-5-max | Anthropic | 美国 | 53 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 8 | GPT-6 Astra openai/gpt-6-astra | openai | 美国 | 53 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 9 | gpt-5.4 gpt-5.4 | openai | 美国网关 | 51 | 视觉理解 图像输入多模态 | 探测OR快照OR | 查看佐证 | |
| 10 | Claude Opus 5 (low) aa/claude-opus-5-low | Anthropic | 美国 | 51 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 11 | Claude Opus 5 anthropic/claude-opus-5 | anthropic | 美国 | 51 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 12 | Claude Fable 5 anthropic/claude-fable-5 | anthropic | 美国 | 50 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 13 | GPT-5.6 Sol (batch) openai/gpt-5.6-sol:batch | openai | 美国 | 47 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 14 | gpt-5.6-sol gpt-5.6-sol | openai | 美国网关 | 47 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 15 | Gemini 3.5 Flash (medium) aa/gemini-3.5-flash-medium | 美国 | 45 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | ||
| 16 | Grok 4.6 x-ai/grok-4.6 | x-ai | 美国 | 44 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 17 | Kimi K3 moonshotai/kimi-k3 | moonshotai | 中国 | 44 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 18 | GPT-5.6 Terra (batch) openai/gpt-5.6-terra:batch | openai | 美国 | 42 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 19 | gpt-5.6-terra gpt-5.6-terra | openai | 美国网关 | 42 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 20 | Claude Opus 4.8 anthropic/claude-opus-4.8 | anthropic | 美国 | 42 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 21 | Claude Sonnet 5 (Non-reasoning) aa/claude-sonnet-5-non-reasoning | Anthropic | 美国 | 42 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 22 | GLM 5.3 Flash z-ai/glm-5.3-flash | z-ai | 中国 | 42 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 23 | Gemini 3.8 Flash google/gemini-3.8-flash | 美国 | 41 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 24 | Qwen3.8 Max (0902) qwen/qwen3.8-max-0902 | qwen | 中国 | 40 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 25 | Qwen3.6 Plus aa/qwen3.6-plus | Alibaba | 中国 | 40 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 26 | grok-build-0.1 grok-build-0.1 | x-ai | 美国网关 | 40 | 视觉理解 图像输入多模态 | 探测OR快照OR | 查看佐证 | |
| 27 | Muse Spark 1.2 meta/muse-spark-1.2 | meta | 美国 | 40 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 28 | DeepSeek V4.1 Flash deepseek/deepseek-v4.1-flash | deepseek | 中国 | 40 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 29 | Gemini 3.7 Flash google/gemini-3.7-flash | 美国 | 39 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 30 | grok-4.5 grok-4.5 | x-ai | 美国网关 | 39 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 31 | gpt-5.5 gpt-5.5 | openai | 美国网关 | 39 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 32 | GPT-5.5 (batch) openai/gpt-5.5:batch | openai | 美国 | 39 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 33 | Claude Sonnet 5 anthropic/claude-sonnet-5 | anthropic | 美国 | 38 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 34 | GPT-5.6 Luna (batch) openai/gpt-5.6-luna:batch | openai | 美国 | 38 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 35 | gpt-5.6-luna gpt-5.6-luna | openai | 美国网关 | 38 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 36 | Gemini 3.5 Flash (minimal) aa/gemini-3.5-flash-minimal | 美国 | 35 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | ||
| 37 | gpt-5.2 gpt-5.2 | openai | 美国网关 | 35 | 视觉理解 图像输入多模态 | 探测OR快照OR | 查看佐证 | |
| 38 | gpt-5.2-pro gpt-5.2-pro | openai | 美国网关 | 35 | 视觉理解 图像输入多模态 | 探测OR快照OR | 查看佐证 | |
| 39 | Gemini 3.6 Flash google/gemini-3.6-flash | 美国 | 34 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 40 | Muse Spark 1.1 meta/muse-spark-1.1 | meta | 美国 | 34 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 41 | Claude Sonnet 4.6 (Non-reasoning, Low Effort) aa/claude-sonnet-4.6-non-reasoning-low-effort | Anthropic | 美国 | 34 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 42 | Qwen3.8 27B qwen/qwen3.8-27b | qwen | 中国 | 34 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 43 | Gemini 3.5 Flash google/gemini-3.5-flash | 美国 | 33 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 44 | Claude Sonnet 4.6 anthropic/claude-sonnet-4.6 | anthropic | 美国 | 31 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 45 | Gemini 3.1 Pro Preview google/gemini-3.1-pro-preview | 美国 | 30 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 46 | Claude 4.5 Haiku aa/claude-4.5-haiku | Anthropic | 美国 | 30 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 47 | o3 aa/o3 | OpenAI | 美国 | 30 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 48 | Step 3.7 Flash aa/step-3.7-flash | StepFun | 中国 | 30 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 49 | gemini-3-5-flash-low gemini-3-5-flash-low | 美国网关 | 30 | 视觉理解 图像输入多模态 | 探测OR快照 | 查看佐证 | ||
| 50 | MiniMax M3 minimax/minimax-m3 | minimax | 中国 | 30 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 51 | Kimi K2.6 moonshotai/kimi-k2.6 | moonshotai | 中国 | 28 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 52 | Kimi K2.7 Code moonshotai/kimi-k2.7-code | moonshotai | 中国 | 26 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 53 | Inkling Small thinkingmachines/inkling-small | thinkingmachines | — | 26 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 54 | Inkling Small (free) thinkingmachines/inkling-small:free | thinkingmachines | — | 26 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 55 | Qwen3.7 Plus qwen/qwen3.7-plus | qwen | 中国 | 26 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 56 | Inkling thinkingmachines/inkling | thinkingmachines | — | 26 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 57 | Inkling (free) thinkingmachines/inkling:free | thinkingmachines | — | 26 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 58 | Grok 4.3 (batch) x-ai/grok-4.3:batch | x-ai | 美国 | 25 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 59 | grok-4.3 grok-4.3 | x-ai | 美国网关 | 25 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 60 | Gemini 3.1 Flash-Lite aa/gemini-3.1-flash-lite | 美国 | 25 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | ||
| 61 | Ling 3.0 Flash VL inclusionai/ling-3.0-flash-vl | inclusionai | 中国 | 25 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 62 | Ling 3.0 Flash VL (free) inclusionai/ling-3.0-flash-vl:free | inclusionai | 中国 | 25 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 63 | GPT-5.4 Mini (batch) openai/gpt-5.4-mini:batch | openai | 美国 | 25 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 64 | gpt-5.4-mini gpt-5.4-mini | openai | 美国网关 | 25 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 65 | Qwen3.5 35B A3B aa/qwen3.5-35b-a3b | Alibaba | 中国 | 24 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 66 | Gemini 3.5 Flash Lite google/gemini-3.5-flash-lite | 美国 | 23 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 67 | MiMo-V2.5 xiaomi/mimo-v2.5 | xiaomi | 中国 | 22 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 68 | Claude Sonnet 4.5 anthropic/claude-sonnet-4.5 | anthropic | 美国 | 21 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 69 | GPT-5.4 Nano openai/gpt-5.4-nano | openai | 美国 | 21 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 70 | Qwen3.5 9B aa/qwen3.5-9b | Alibaba | 中国 | 21 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 71 | Qwen3.5 397B A17B qwen/qwen3.5-397b-a17b | qwen | 中国 | 19 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 72 | Claude Haiku 4.5 anthropic/claude-haiku-4.5 | anthropic | 美国 | 18 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 73 | GPT-5 Mini openai/gpt-5-mini | openai | 美国 | 17 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 74 | Gemini 2.5 Pro google/gemini-2.5-pro | 美国 | 17 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 75 | Qwen3.5-122B-A10B qwen/qwen3.5-122b-a10b | qwen | 中国 | 16 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 76 | Gemini 3.1 Flash Lite Preview google/gemini-3.1-flash-lite-preview | 美国 | 16 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 77 | Gemma 4 31B google/gemma-4-31b-it | 美国 | 15 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 78 | Gemma 4 31B (free) google/gemma-4-31b-it:free | 美国 | 15 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 79 | Mistral Medium 3.5 mistralai/mistral-medium-3-5 | mistralai | 其他 | 15 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 80 | Mistral Small 4 mistralai/mistral-small-2603 | mistralai | 其他 | 12 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 81 | Mistral Large 3 2512 mistralai/mistral-large-2512 | mistralai | 其他 | 10 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 82 | gpt-4.1-nano gpt-4.1-nano | openai | 美国网关 | 10 | 视觉理解 图像输入多模态 | 探测OR快照OR | 查看佐证 | |
| 83 | Llama 4 Maverick meta-llama/llama-4-maverick | meta-llama | 美国 | 9 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 84 | NVIDIA Nemotron Nano 12B v2 VL aa/nvidia-nemotron-nano-12b-v2-vl | NVIDIA | 美国 | 9 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 85 | Step3 VL 10B aa/step3-vl-10b | StepFun | 中国 | 9 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 86 | Llama 4 Scout meta-llama/llama-4-scout | meta-llama | 美国 | 7 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 87 | Llama 3.2 90B (Vision) aa/llama-3.2-90b-vision | Meta | 美国 | 6 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 88 | Ministral 3 14B 2512 mistralai/ministral-14b-2512 | mistralai | 其他 | 6 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 89 | Ministral 3 8B 2512 mistralai/ministral-8b-2512 | mistralai | 其他 | 6 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 90 | Gemma 3 27B google/gemma-3-27b-it | 美国 | 5 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 91 | Ministral 3 3B 2512 mistralai/ministral-3b-2512 | mistralai | 其他 | 5 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 92 | Gemma 3 12B google/gemma-3-12b-it | 美国 | 4 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 93 | Llama 3.2 11B (Vision) aa/llama-3.2-11b-vision | Meta | 美国 | 3 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 94 | LFM2.5-VL-1.6B aa/lfm2.5-vl-1.6b | Liquid AI | — | 1 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 |
启发式维度(中文/英文/OCR/软件等)在无官方公开 bench 时由厂商归属、模态与关联模型热度估算,仅供选型参考; 客观能力以 AA 智力/代码/Agent 与本站实测为准。交叉验证: 用量榜 · 模型目录 · 实验室。
站内推荐
同系工具:Clavue CLI / imux IDE / clavue-2.1
Clavue · CLI 与 Agent 平台
CLI / GUI Agent 运行时、设备登录、会员额度与 OpenAI 兼容 API(api.clavue.com)。开发脚本、CI 与本地工具一条链路。
打开 Clavue ↗imux · 原生 macOS AI IDE
Clavue 平台的原生 IDE:多 Agent 分屏、Ghostty 级终端、Agent Chat、浏览器自动化与 Supervisor——不是又一个 Electron 壳。
了解 imux ↗Clavue 2.1 · 产品级大模型
旗舰模型 clavue-2.1(及 fast / pro / rev):适合复杂推理与长程 Agent 循环。Chat、imux、API 共用会员额度。
查看模型 ↗