模型智能能力 · 多维天梯

音频能力榜

AI 模型语音识别、合成与音乐生成综合排名

数据更新于 2026-07-31 · 能力库 206 条(网关 49 · 站外 157 · AA 173 · Arena 100 · 当前榜 12 · OpenRouter 实时已接入 · 知识库 159 模 / 31 族 / 26 维

音频能力榜 配图

模型天梯 · modality

音频能力榜

本榜评估 AI 模型在音频领域的综合能力,涵盖语音转文本(ASR)、文本转语音(TTS)、音频内容理解、音乐生成与编辑等任务。数据来源于专业音频基准测试(如 AudioBench、VoiceBench)、LMSYS Arena 音频专项对战、API 调用用量与成功率统计,以及基于用户反馈的启发式评分。解读排名时需注意总分反映多任务平均表现,建议结合细分得分与具体用例;高排名模型通常在通用音频场景下更可靠,但实际效果受输入质量、prompt 工程和语言覆盖影响。榜单数据定期同步最新模型版本与基准结果。

  • 多音频基准加权平均得分
  • API 用量与任务成功率统计
  • 用户反馈启发式质量评估
显示 12全量 12

列表 12 / 12(全库 12)· 点击「佐证」查看评分依据与测试题面

#模型厂商地区音频分相对说明证据源佐证
🥇Gemini 3.5 Flash
google/gemini-3.5-flash
google美国56
音频
语音 / 音频模态
AAOR站外对照
查看佐证
🥈Muse Spark 1.1
meta/muse-spark-1.1
meta美国56
音频
语音 / 音频模态
AAOR站外对照
查看佐证
🥉Gemini 3.6 Flash
google/gemini-3.6-flash
google美国55
音频
语音 / 音频模态
AAOR站外对照
查看佐证
4Gemini 3.1 Pro Preview
google/gemini-3.1-pro-preview
google美国52
音频
语音 / 音频模态
AAOR站外对照
查看佐证
5gpt-4o-audio-preview
gpt-4o-audio-preview
openai美国网关50
音频
语音 / 音频模态
清单
查看佐证
6gpt-4o-realtime-preview
gpt-4o-realtime-preview
openai美国网关50
音频
语音 / 音频模态
清单OR
查看佐证
7Inkling
thinkingmachines/inkling
thinkingmachines44
音频
语音 / 音频模态
AAOR站外对照
查看佐证
8Inkling Small
thinkingmachines/inkling-small
thinkingmachines43
音频
语音 / 音频模态
AAOR站外对照
查看佐证
9MiMo-V2.5
xiaomi/mimo-v2.5
xiaomi中国42
音频
语音 / 音频模态
AAOR站外对照
查看佐证
10Gemini 3.5 Flash Lite
google/gemini-3.5-flash-lite
google美国40
音频
语音 / 音频模态
AAOR站外对照
查看佐证
11Gemini 2.5 Pro
google/gemini-2.5-pro
google美国28
音频
语音 / 音频模态
AAOR站外对照
查看佐证
12Gemini 3.1 Flash Lite Preview
google/gemini-3.1-flash-lite-preview
google美国28
音频
语音 / 音频模态
AAOR站外对照
查看佐证

启发式维度(中文/英文/OCR/软件等)在无官方公开 bench 时由厂商归属、模态与关联模型热度估算,仅供选型参考; 客观能力以 AA 智力/代码/Agent 与本站实测为准。交叉验证: 用量榜 · 模型目录 · 实验室

GrokCode 音频能力模型天梯 | AI 语音音乐模型排名 · GrokCode 倍率榜