🥇
Claude Opus 5 (max)Anthropic · 美国
61 图像理解
视觉理解
Image understanding. 图像理解私榜:支持图像输入的多模态模型,看图问答与视觉理解选型。
일부 설명은 영어/중국어일 수 있습니다. 모델명은 원문 유지.
업데이트:数据更新于 2026-08-03 · AA 301 · gateway 49 · 84 · OpenRouter live · 현재 공개 보드

模型天梯 · modality
Image understanding
| # | 模型 | 厂商 | 地区 | 图像理解 | 相对 | 说明 | 证据源 | 佐证 |
|---|---|---|---|---|---|---|---|---|
| 🥇 | Claude Opus 5 (max) aa/claude-opus-5-max | Anthropic | 美国 | 61 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 🥈 | Claude Opus 5 anthropic/claude-opus-5 | anthropic | 美国 | 61 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 🥉 | Claude Fable 5 (with fallback) aa/claude-fable-5-with-fallback | Anthropic | 美国 | 60 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 4 | Claude Opus 5 (xhigh) aa/claude-opus-5-xhigh | Anthropic | 美国 | 60 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 5 | Claude Fable 5 anthropic/claude-fable-5 | anthropic | 美国 | 60 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 6 | Claude Opus 5 (high) aa/claude-opus-5-high | Anthropic | 美国 | 59 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 7 | gpt-5.6-sol gpt-5.6-sol | openai | 美国网关 | 59 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 8 | Kimi K3 moonshotai/kimi-k3 | moonshotai | 中国 | 57 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 9 | Claude Opus 5 (medium) aa/claude-opus-5-medium | Anthropic | 美国 | 56 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 10 | Claude Opus 4.8 anthropic/claude-opus-4.8 | anthropic | 美国 | 56 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 11 | gpt-5.6-terra gpt-5.6-terra | openai | 美国网关 | 55 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 12 | gpt-5.5 gpt-5.5 | openai | 美国网关 | 55 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 13 | grok-4.5 grok-4.5 | x-ai | 美国网关 | 54 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 14 | Claude Opus 4.7 anthropic/claude-opus-4.7 | anthropic | 美国 | 54 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 15 | Claude Sonnet 5 anthropic/claude-sonnet-5 | anthropic | 美国 | 53 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 16 | Claude Sonnet 5 (max) aa/claude-sonnet-5-max | Anthropic | 美国 | 53 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 17 | gpt-5.4 gpt-5.4 | openai | 美国网关 | 51 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 18 | gpt-5.6-luna gpt-5.6-luna | openai | 美国网关 | 51 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 19 | Claude Opus 5 (low) aa/claude-opus-5-low | Anthropic | 美国 | 51 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 20 | Muse Spark 1.1 meta/muse-spark-1.1 | meta | 美国 | 51 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 21 | Gemini 3.5 Flash google/gemini-3.5-flash | 美国 | 50 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 22 | Gemini 3.6 Flash google/gemini-3.6-flash | 美国 | 50 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 23 | Claude Sonnet 4.6 anthropic/claude-sonnet-4.6 | anthropic | 美国 | 47 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 24 | Gemini 3.1 Pro Preview google/gemini-3.1-pro-preview | 美国 | 47 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 25 | Gemini 3.5 Flash (medium) aa/gemini-3.5-flash-medium | 美国 | 45 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | ||
| 26 | MiniMax M3 minimax/minimax-m3 | minimax | 中国 | 44 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 27 | Kimi K2.6 moonshotai/kimi-k2.6 | moonshotai | 中国 | 44 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 28 | Claude Sonnet 5 (Non-reasoning) aa/claude-sonnet-5-non-reasoning | Anthropic | 美国 | 42 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 29 | Kimi K2.7 Code moonshotai/kimi-k2.7-code | moonshotai | 中国 | 42 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 30 | Nex-N2-Pro nex-agi/nex-n2-pro | nex-agi | — | 41 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 31 | Inkling thinkingmachines/inkling | thinkingmachines | — | 41 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 32 | Inkling Small thinkingmachines/inkling-small | thinkingmachines | — | 40 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 33 | gpt-5.4-mini gpt-5.4-mini | openai | 美国网关 | 40 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 34 | grok-build-0.1 grok-build-0.1 | x-ai | 美国网关 | 40 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 35 | Qwen3.6 Plus qwen/qwen3.6-plus | qwen | 中国 | 40 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 36 | Qwen3.7 Plus qwen/qwen3.7-plus | qwen | 中国 | 39 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 37 | GPT-5.4 Nano openai/gpt-5.4-nano | openai | 美国 | 38 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 38 | grok-4.3 grok-4.3 | x-ai | 美国网关 | 38 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 39 | MiMo-V2.5 xiaomi/mimo-v2.5 | xiaomi | 中国 | 37 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 40 | GPT-5.1 openai/gpt-5.1 | openai | 美国 | 37 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 41 | Gemini 3.5 Flash Lite google/gemini-3.5-flash-lite | 美国 | 37 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 42 | Claude Sonnet 4.5 anthropic/claude-sonnet-4.5 | anthropic | 美国 | 36 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 43 | Kimi K2.5 moonshotai/kimi-k2.5 | moonshotai | 中国 | 35 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 44 | Gemini 3.5 Flash (minimal) aa/gemini-3.5-flash-minimal | 美国 | 35 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | ||
| 45 | GPT-5 openai/gpt-5 | openai | 美国 | 35 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 46 | gpt-5.2 gpt-5.2 | openai | 美国网关 | 35 | 视觉理解 图像输入多模态 | 探测OR快照OR | 查看佐证 | |
| 47 | gpt-5.2-pro gpt-5.2-pro | openai | 美国网关 | 35 | 视觉理解 图像输入多模态 | 探测OR快照OR | 查看佐证 | |
| 48 | Claude Sonnet 4.6 (Non-reasoning, Low Effort) aa/claude-sonnet-4.6-non-reasoning-low-effort | Anthropic | 美国 | 34 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | |
| 49 | Qwen3.5 397B A17B qwen/qwen3.5-397b-a17b | qwen | 中国 | 34 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 50 | Qwen3.5-122B-A10B qwen/qwen3.5-122b-a10b | qwen | 中国 | 32 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 51 | Step 3.7 Flash stepfun/step-3.7-flash | stepfun | 中国 | 30 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 52 | Claude 4.5 Haiku aa/claude-4.5-haiku | Anthropic | 美国 | 30 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 53 | o3 aa/o3 | OpenAI | 美国 | 30 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 54 | gemini-3-5-flash-low gemini-3-5-flash-low | 美国网关 | 30 | 视觉理解 图像输入多模态 | 探测OR快照 | 查看佐证 | ||
| 55 | Mistral Medium 3.5 mistralai/mistral-medium-3-5 | mistralai | 其他 | 30 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 56 | Claude Haiku 4.5 anthropic/claude-haiku-4.5 | anthropic | 美国 | 30 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 57 | Gemma 4 31B google/gemma-4-31b-it | 美国 | 29 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 58 | Gemma 4 31B (free) google/gemma-4-31b-it:free | 美国 | 29 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 59 | Claude Sonnet 4 anthropic/claude-sonnet-4 | anthropic | 美国 | 29 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 60 | Gemini 2.5 Pro google/gemini-2.5-pro | 美国 | 26 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 61 | Gemma 4 26B A4B (free) google/gemma-4-26b-a4b-it:free | 美国 | 26 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 62 | GPT-5 Mini openai/gpt-5-mini | openai | 美国 | 25 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 63 | Gemini 3.1 Flash Lite Preview google/gemini-3.1-flash-lite-preview | 美国 | 25 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 64 | Gemini 3.1 Flash-Lite aa/gemini-3.1-flash-lite | 美国 | 25 | 视觉理解 图像输入多模态 | AA快照站外对照Arena | 查看佐证 | ||
| 65 | Qwen3.5-35B-A3B qwen/qwen3.5-35b-a3b | qwen | 中国 | 24 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 66 | Qwen3.5-9B qwen/qwen3.5-9b | qwen | 中国 | 21 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 67 | Mistral Small 4 mistralai/mistral-small-2603 | mistralai | 其他 | 20 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 68 | Nova 2 Lite amazon/nova-2-lite-v1 | amazon | 美国 | 18 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 69 | Mistral Large 3 2512 mistralai/mistral-large-2512 | mistralai | 其他 | 16 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 70 | GPT-4.1 Mini openai/gpt-4.1-mini | openai | 美国 | 15 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 71 | Mistral Medium 3.1 mistralai/mistral-medium-3.1 | mistralai | 其他 | 15 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 72 | Llama 4 Maverick meta-llama/llama-4-maverick | meta-llama | 美国 | 14 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 73 | Ministral 3 14B 2512 mistralai/ministral-14b-2512 | mistralai | 其他 | 11 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 74 | Llama 4 Scout meta-llama/llama-4-scout | meta-llama | 美国 | 10 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 75 | gpt-4.1-nano gpt-4.1-nano | openai | 美国网关 | 10 | 视觉理解 图像输入多模态 | 探测AAOR | 查看佐证 | |
| 76 | Ministral 3 8B 2512 mistralai/ministral-8b-2512 | mistralai | 其他 | 9 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 77 | NVIDIA Nemotron Nano 12B v2 VL aa/nvidia-nemotron-nano-12b-v2-vl | NVIDIA | 美国 | 9 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 78 | Step3 VL 10B aa/step3-vl-10b | StepFun | 中国 | 9 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 79 | Gemma 3 27B google/gemma-3-27b-it | 美国 | 7 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 80 | Ministral 3 3B 2512 mistralai/ministral-3b-2512 | mistralai | 其他 | 7 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | |
| 81 | Llama 3.2 90B (Vision) aa/llama-3.2-90b-vision | Meta | 美国 | 6 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 82 | Gemma 3 12B google/gemma-3-12b-it | 美国 | 6 | 视觉理解 图像输入多模态 | AAOR站外对照 | 查看佐证 | ||
| 83 | Llama 3.2 11B (Vision) aa/llama-3.2-11b-vision | Meta | 美国 | 3 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 | |
| 84 | LFM2.5-VL-1.6B aa/lfm2.5-vl-1.6b | Liquid AI | — | 1 | 视觉理解 图像输入多模态 | AA快照站外对照 | 查看佐证 |
启发式维度(中文/英文/OCR/软件等)在无官方公开 bench 时由厂商归属、模态与关联模型热度估算,仅供选型参考; 客观能力以 AA 智力/代码/Agent 与本站实测为准。交叉验证: 用量榜 · 模型目录 · 实验室。
Clavue CLI / imux IDE / clavue-2.1
CLI / GUI Agent 运行时、设备登录、会员额度与 OpenAI 兼容 API(api.clavue.com)。开发脚本、CI 与本地工具一条链路。
打开 Clavue ↗Clavue 平台的原生 IDE:多 Agent 分屏、Ghostty 级终端、Agent Chat、浏览器自动化与 Supervisor——不是又一个 Electron 壳。
了解 imux ↗旗舰模型 clavue-2.1(及 fast / pro / rev):适合复杂推理与长程 Agent 循环。Chat、imux、API 共用会员额度。
查看模型 ↗