本站网关上架模型 · 同步自 OpenRouter · 337 个模型 · source=openrouter · 2026-08-01T19:50:57.420Z
PaddleOCR-VL-1.5-0.9B
PaddleOCR-VL-1.5-0.9B
PaddleOCR-VL-1.5-0.9B是百度飞桨推出的0.9B参数视觉语言模型,2026年1月发布1.5版,在OmniDocBench v1.5基准上达到94.5% SOTA准确率。支持布局分析后的元素级识别,包括文本定位、复杂表格、数学公式、图表、印章识别及文本spotting,兼容109种语言。采用原生分辨率视觉编码器、Adaptive MLP连接器与轻量ERNIE-4.5-0.3B语言模型,专为扫描、扭曲、屏幕拍摄、照明变化等真实世界文档场景优化。适合文档智能、发票提取、RAG构建、法律与学术文档处理等场景,资源消耗低、推理高效。以厂商/网关为准。
0.9B参数紧凑VLM,专注鲁棒文档解析与多任务OCR

PaddleOCR-VL
PaddlePaddle(百度) · Apache-2.0 · image-text-to-text · 知识库 159 模 / 31 族
0.9B参数紧凑VLM,专注鲁棒文档解析与多任务OCR
PaddleOCR-VL-1.5-0.9B是百度飞桨推出的0.9B参数视觉语言模型,2026年1月发布1.5版,在OmniDocBench v1.5基准上达到94.5% SOTA准确率。支持布局分析后的元素级识别,包括文本定位、复杂表格、数学公式、图表、印章识别及文本spotting,兼容109种语言。采用原生分辨率视觉编码器、Adaptive MLP连接器与轻量ERNIE-4.5-0.3B语言模型,专为扫描、扭曲、屏幕拍摄、照明变化等真实世界文档场景优化。适合文档智能、发票提取、RAG构建、法律与学术文档处理等场景,资源消耗低、推理高效。以厂商/网关为准。
PaddleOCR-VL是百度飞桨推出的系列紧凑型视觉语言模型,核心为0.9B参数的PaddleOCR-VL-0.9B,融合NaViT动态分辨率视觉编码器与ERNIE-4.5-0.3B语言模型,专攻文档解析任务。支持109种语言,擅长识别文本、表格、公式、图表、印章等复杂元素,支持Markdown与JSON结构化输出。最新1.6版本在OmniDocBench v1.6上达到96.33% SOTA成绩,对扫描、倾斜、折叠、屏幕拍摄等真实场景鲁棒性强,推理速度快、资源占用低,适合实际部署。适用场景包括PDF/图像文档批量处理、RAG数据准备、发票合同提取、学术文献数字化及多语言历史文档识别。边界在于专注文档领域,通用视觉对话或非结构化图像理解能力有限;极端罕见布局或手写变体可能需额外微调。
PaddleOCR-VL 是百度飞桨开源的多模态文档理解与 OCR 系列模型,面向版面分析、表格/公式/图表识别与图文问答。参数量覆盖约 0.9B 的轻量端侧形态,适合中文文档解析、票据与扫描件结构化抽取。本站网关以短 ID(如 PaddleOCR-VL-1.5-0.9B)上架,便于中转与测速。
PaddleOCR-VL 是百度飞桨开源的多模态文档理解与 OCR 系列模型,面向版面分析、表格/公式/图表识别与图文问答。参数量覆盖约 0.9B 的轻量端侧形态,适合中文文档解析、票据与扫描件结构化抽取。本站网关以短 ID(如 PaddleOCR-VL-1.5-0.9B)上架,便于中转与测速。 本站网关上架模型。
- 0.9B参数紧凑VLM,专注鲁棒文档解析与多任务OCR
- 0.9B超紧凑VLM,专为多语言文档解析与结构化提取设计
- 参数量档位 0.9B
- 当前版本线 1.5
- 归并版本 1 个
- 许可 Apache-2.0
- 任务 image-text-to-text
- 1.5版本升级自PaddleOCR-VL-0.9B,参数量0.9B,扩展印章识别与文本spotting,强化真实场景鲁棒性
- PaddleOCR-VL系列2025年10月以0.9B基础模型发布,聚焦高效多语言文档解析;2026年1月推出1.5版本增强鲁棒性与多任务能力,在OmniDocBench v1.5达94.5%;2026年5-6月发布1.6版本,引入区域感知
适用场景
- 多语言PDF与图像文档批量解析
- 发票、合同与票据结构化信息提取
- 学术论文、表格与公式识别
- 历史文档、手写文本与印章数字化
能力 / 优势
- 0.9B参数实现SOTA文档解析性能,推理高效低资源消耗
- 支持109种语言,复杂元素识别领先且输出结构化
- 对真实世界扭曲、倾斜、光照变化鲁棒性强
边界 / 不适合
- 极端复杂或罕见布局泛化能力可能不足
- 作为专用文档模型,通用对话与非文档视觉任务较弱
接入提示:支持transformers与vLLM推理服务器;OpenAI兼容接口、网关短ID及测速入口以平台为准
常见问题
支持哪些文档类型和语言?
支持扫描件、PDF图像、屏幕截图等,支持109种语言,具体以厂商为准
是否需要完整PaddleOCR-VL pipeline?
推荐使用布局分析+ VLM两阶段pipeline,直接调用VLM组件效果可能不同,以官方文档为准
历史版本 / 相关变体
| 版本 | 模型 | 参数 | 来源 | 说明 |
|---|---|---|---|---|
| 1.5当前 | PaddleOCR-VL-1.5-0.9B PaddleOCR-VL-1.5-0.9B | 0.9B | 本站网关 | 免费/网关 |
定价与限制
| 输入 | 随网关倍率 / 百万 tokens |
| 输出 | 随网关倍率 / 百万 tokens |
| 缓存读 / 写 | — / — |
| 最大输出 | — |
| 输入模态 | text, image |
| 输出模态 | text |
| HF | PaddlePaddle/PaddleOCR-VL |
价格与基准分优先同步自 OpenRouter;网关短 ID 由本站平台清单补全,介绍/历史版本融合 Hugging Face 检索与家族知识库。能力验真请用 bench_v1 实验室 · OCR 天梯。
站内推荐
同系工具:Clavue CLI / imux IDE / clavue-2.1
Clavue · CLI 与 Agent 平台
CLI / GUI Agent 运行时、设备登录、会员额度与 OpenAI 兼容 API(api.clavue.com)。开发脚本、CI 与本地工具一条链路。
打开 Clavue ↗imux · 原生 macOS AI IDE
Clavue 平台的原生 IDE:多 Agent 分屏、Ghostty 级终端、Agent Chat、浏览器自动化与 Supervisor——不是又一个 Electron 壳。
了解 imux ↗Clavue 2.1 · 产品级大模型
旗舰模型 clavue-2.1(及 fast / pro / rev):适合复杂推理与长程 Agent 循环。Chat、imux、API 共用会员额度。
查看模型 ↗