Model Catalog · AA / Arena 对标

模型目录与家族版本

在 GrokCode 内容体系中,models-catalog 枢纽是模型目录与家族版本的核心模块。它整合主流 AI 模型的树状家族关系、发布迭代时间线及参数规格等公开数据,与 ladder-system 的多维天梯和 ocr-ecosystem 的工具生态互补。用户路径包括从订阅比价或天梯入口进入目录检索模型、浏览版本历史、对比规格,并跳转验证性能,帮助开发者与研究者高效完成模型选型与追踪。

数据更新于 2026-07-31 · AA 83 · Arena 44 · OR-AA 126 · 知识库 159 模 / 31 族 / 26 维 · 配图 177

对标 Artificial Analysis + Arena Agent + 用量榜

目录表已补 AA 智力(OpenRouter 实时 / OR 快照 / AA 公开榜)与 Arena 排名。完整条形图见天梯;真实流量热度见用量 / 任务消费榜。

OCR 与文档理解生态

在 GrokCode 全站内容体系中,ocr-ecosystem 枢纽定位为 OCR 与文档理解生态模块,衔接模型目录、模型天梯及 API 订阅比价三大核心。它聚焦 PaddleOCR 等开源项目、支持文档理解的多模态模型历史版本与性能数据。用户可通过主站多模态天梯或模型目录入口进入,探索工具对比、基准佐证及部署路径,实现从模型评估到实际应用的平滑过渡。该枢纽为开发者、研究人员和企业提供专业、可核验的资源,帮助优化文档处理流程中的 AI

数据状态

同步自 OpenRouter · 337 个模型 · 含网关上架 47 个短 ID · source=openrouter · 2026-08-01T19:44:32.467Z

PaddleOCR-VL · PaddleOCR-VL-1.5-0.9B 配图
模型家族 · 历史版本 · 知识库

PaddleOCR-VL

PaddlePaddle(百度) · Apache-2.0 · image-text-to-text · 知识库 159 模 / 31 族

0.9B参数紧凑VLM,专注鲁棒文档解析与多任务OCR

PaddleOCR-VL-1.5-0.9B是百度飞桨推出的0.9B参数视觉语言模型,2026年1月发布1.5版,在OmniDocBench v1.5基准上达到94.5% SOTA准确率。支持布局分析后的元素级识别,包括文本定位、复杂表格、数学公式、图表、印章识别及文本spotting,兼容109种语言。采用原生分辨率视觉编码器、Adaptive MLP连接器与轻量ERNIE-4.5-0.3B语言模型,专为扫描、扭曲、屏幕拍摄、照明变化等真实世界文档场景优化。适合文档智能、发票提取、RAG构建、法律与学术文档处理等场景,资源消耗低、推理高效。以厂商/网关为准。

PaddleOCR-VL是百度飞桨推出的系列紧凑型视觉语言模型,核心为0.9B参数的PaddleOCR-VL-0.9B,融合NaViT动态分辨率视觉编码器与ERNIE-4.5-0.3B语言模型,专攻文档解析任务。支持109种语言,擅长识别文本、表格、公式、图表、印章等复杂元素,支持Markdown与JSON结构化输出。最新1.6版本在OmniDocBench v1.6上达到96.33% SOTA成绩,对扫描、倾斜、折叠、屏幕拍摄等真实场景鲁棒性强,推理速度快、资源占用低,适合实际部署。适用场景包括PDF/图像文档批量处理、RAG数据准备、发票合同提取、学术文献数字化及多语言历史文档识别。边界在于专注文档领域,通用视觉对话或非结构化图像理解能力有限;极端罕见布局或手写变体可能需额外微调。

PaddleOCR-VL 是百度飞桨开源的多模态文档理解与 OCR 系列模型,面向版面分析、表格/公式/图表识别与图文问答。参数量覆盖约 0.9B 的轻量端侧形态,适合中文文档解析、票据与扫描件结构化抽取。本站网关以短 ID(如 PaddleOCR-VL-1.5-0.9B)上架,便于中转与测速。

PaddleOCR-VL 是百度飞桨开源的多模态文档理解与 OCR 系列模型,面向版面分析、表格/公式/图表识别与图文问答。参数量覆盖约 0.9B 的轻量端侧形态,适合中文文档解析、票据与扫描件结构化抽取。本站网关以短 ID(如 PaddleOCR-VL-1.5-0.9B)上架,便于中转与测速。 本站网关上架模型。

  • 0.9B参数紧凑VLM,专注鲁棒文档解析与多任务OCR
  • 0.9B超紧凑VLM,专为多语言文档解析与结构化提取设计
  • 参数量档位 0.9B
  • 当前版本线 1.5
  • 归并版本 1 个
  • 许可 Apache-2.0
  • 任务 image-text-to-text
  • 1.5版本升级自PaddleOCR-VL-0.9B,参数量0.9B,扩展印章识别与文本spotting,强化真实场景鲁棒性
  • PaddleOCR-VL系列2025年10月以0.9B基础模型发布,聚焦高效多语言文档解析;2026年1月推出1.5版本增强鲁棒性与多任务能力,在OmniDocBench v1.5达94.5%;2026年5-6月发布1.6版本,引入区域感知

适用场景

  • 多语言PDF与图像文档批量解析
  • 发票、合同与票据结构化信息提取
  • 学术论文、表格与公式识别
  • 历史文档、手写文本与印章数字化

能力 / 优势

  • 0.9B参数实现SOTA文档解析性能,推理高效低资源消耗
  • 支持109种语言,复杂元素识别领先且输出结构化
  • 对真实世界扭曲、倾斜、光照变化鲁棒性强

边界 / 不适合

  • 极端复杂或罕见布局泛化能力可能不足
  • 作为专用文档模型,通用对话与非文档视觉任务较弱

接入提示:支持transformers与vLLM推理服务器;OpenAI兼容接口、网关短ID及测速入口以平台为准

OCRVLM文档解析轻量模型多语言ocrvlmdocument-parsingpaddlepaddlecompact-model多模态开源中文0.9Bv1.5

常见问题

支持哪些文档类型和语言?

支持扫描件、PDF图像、屏幕截图等,支持109种语言,具体以厂商为准

是否需要完整PaddleOCR-VL pipeline?

推荐使用布局分析+ VLM两阶段pipeline,直接调用VLM组件效果可能不同,以官方文档为准

历史版本 / 相关变体

版本模型参数来源说明
1.5当前PaddleOCR-VL-1.5-0.9B
PaddleOCR-VL-1.5-0.9B
0.9B本站网关 免费/网关
模型384
厂商67
免费64
Tools310
有智力分107
重置天梯对标 →用量榜 →

匹配 1 / 384 · 第 1/1 页 · 价格 USD/M tokens · AA 智力 = OpenRouter 透出优先,缺则用公开榜快照 · Arena = lmarena.ai

模型上下文输入输出能力AA 智力代码Arena操作
PaddleOCR-VL-1.5-0.9B
PaddleOCR-VL-1.5-0.9B
免费免费
Vision开源

数据源:OpenRouter 公开 Models API(缓存约 1 小时)。本站聚合展示,不构成购买建议;实测能力请用实验室。