数据状态

本站网关上架模型 · 同步自 OpenRouter · 337 个模型 · source=openrouter · 2026-08-01T19:50:57.420Z

paddlepaddle网关上架

PaddleOCR-VL-1.5-0.9B

PaddleOCR-VL-1.5-0.9B

PaddleOCR-VL-1.5-0.9B是百度飞桨推出的0.9B参数视觉语言模型,2026年1月发布1.5版,在OmniDocBench v1.5基准上达到94.5% SOTA准确率。支持布局分析后的元素级识别,包括文本定位、复杂表格、数学公式、图表、印章识别及文本spotting,兼容109种语言。采用原生分辨率视觉编码器、Adaptive MLP连接器与轻量ERNIE-4.5-0.3B语言模型,专为扫描、扭曲、屏幕拍摄、照明变化等真实世界文档场景优化。适合文档智能、发票提取、RAG构建、法律与学术文档处理等场景,资源消耗低、推理高效。以厂商/网关为准。

0.9B参数紧凑VLM,专注鲁棒文档解析与多任务OCR

免费/网关Vision开源倾向text+image->textimage-text-to-text
上下文
输入 $/M网关计价
输出 $/M网关计价
智力指数
代码指数
Agent / Arena
PaddleOCR-VL · PaddleOCR-VL-1.5-0.9B 配图
模型家族 · 历史版本 · 知识库

PaddleOCR-VL

PaddlePaddle(百度) · Apache-2.0 · image-text-to-text · 知识库 159 模 / 31 族

0.9B参数紧凑VLM,专注鲁棒文档解析与多任务OCR

PaddleOCR-VL-1.5-0.9B是百度飞桨推出的0.9B参数视觉语言模型,2026年1月发布1.5版,在OmniDocBench v1.5基准上达到94.5% SOTA准确率。支持布局分析后的元素级识别,包括文本定位、复杂表格、数学公式、图表、印章识别及文本spotting,兼容109种语言。采用原生分辨率视觉编码器、Adaptive MLP连接器与轻量ERNIE-4.5-0.3B语言模型,专为扫描、扭曲、屏幕拍摄、照明变化等真实世界文档场景优化。适合文档智能、发票提取、RAG构建、法律与学术文档处理等场景,资源消耗低、推理高效。以厂商/网关为准。

PaddleOCR-VL是百度飞桨推出的系列紧凑型视觉语言模型,核心为0.9B参数的PaddleOCR-VL-0.9B,融合NaViT动态分辨率视觉编码器与ERNIE-4.5-0.3B语言模型,专攻文档解析任务。支持109种语言,擅长识别文本、表格、公式、图表、印章等复杂元素,支持Markdown与JSON结构化输出。最新1.6版本在OmniDocBench v1.6上达到96.33% SOTA成绩,对扫描、倾斜、折叠、屏幕拍摄等真实场景鲁棒性强,推理速度快、资源占用低,适合实际部署。适用场景包括PDF/图像文档批量处理、RAG数据准备、发票合同提取、学术文献数字化及多语言历史文档识别。边界在于专注文档领域,通用视觉对话或非结构化图像理解能力有限;极端罕见布局或手写变体可能需额外微调。

PaddleOCR-VL 是百度飞桨开源的多模态文档理解与 OCR 系列模型,面向版面分析、表格/公式/图表识别与图文问答。参数量覆盖约 0.9B 的轻量端侧形态,适合中文文档解析、票据与扫描件结构化抽取。本站网关以短 ID(如 PaddleOCR-VL-1.5-0.9B)上架,便于中转与测速。

PaddleOCR-VL 是百度飞桨开源的多模态文档理解与 OCR 系列模型,面向版面分析、表格/公式/图表识别与图文问答。参数量覆盖约 0.9B 的轻量端侧形态,适合中文文档解析、票据与扫描件结构化抽取。本站网关以短 ID(如 PaddleOCR-VL-1.5-0.9B)上架,便于中转与测速。 本站网关上架模型。

  • 0.9B参数紧凑VLM,专注鲁棒文档解析与多任务OCR
  • 0.9B超紧凑VLM,专为多语言文档解析与结构化提取设计
  • 参数量档位 0.9B
  • 当前版本线 1.5
  • 归并版本 1 个
  • 许可 Apache-2.0
  • 任务 image-text-to-text
  • 1.5版本升级自PaddleOCR-VL-0.9B,参数量0.9B,扩展印章识别与文本spotting,强化真实场景鲁棒性
  • PaddleOCR-VL系列2025年10月以0.9B基础模型发布,聚焦高效多语言文档解析;2026年1月推出1.5版本增强鲁棒性与多任务能力,在OmniDocBench v1.5达94.5%;2026年5-6月发布1.6版本,引入区域感知

适用场景

  • 多语言PDF与图像文档批量解析
  • 发票、合同与票据结构化信息提取
  • 学术论文、表格与公式识别
  • 历史文档、手写文本与印章数字化

能力 / 优势

  • 0.9B参数实现SOTA文档解析性能,推理高效低资源消耗
  • 支持109种语言,复杂元素识别领先且输出结构化
  • 对真实世界扭曲、倾斜、光照变化鲁棒性强

边界 / 不适合

  • 极端复杂或罕见布局泛化能力可能不足
  • 作为专用文档模型,通用对话与非文档视觉任务较弱

接入提示:支持transformers与vLLM推理服务器;OpenAI兼容接口、网关短ID及测速入口以平台为准

OCRVLM文档解析轻量模型多语言ocrvlmdocument-parsingpaddlepaddlecompact-model多模态开源中文0.9Bv1.5

常见问题

支持哪些文档类型和语言?

支持扫描件、PDF图像、屏幕截图等,支持109种语言,具体以厂商为准

是否需要完整PaddleOCR-VL pipeline?

推荐使用布局分析+ VLM两阶段pipeline,直接调用VLM组件效果可能不同,以官方文档为准

历史版本 / 相关变体

版本模型参数来源说明
1.5当前PaddleOCR-VL-1.5-0.9B
PaddleOCR-VL-1.5-0.9B
0.9B本站网关 免费/网关

定价与限制

输入随网关倍率 / 百万 tokens
输出随网关倍率 / 百万 tokens
缓存读 / 写 /
最大输出
输入模态text, image
输出模态text
HFPaddlePaddle/PaddleOCR-VL

价格与基准分优先同步自 OpenRouter;网关短 ID 由本站平台清单补全,介绍/历史版本融合 Hugging Face 检索与家族知识库。能力验真请用 bench_v1 实验室 · OCR 天梯