百度发布PaddleOCR-VL-1.5:0.9B模型在OmniDocBench v1.5上达 94.5% 准确率
新版模型新增印章识别与文本检测识别一体化能力,并推出Real5-OmniDocBench基准,用于评测扫描、弯折、屏幕拍照等真实场景下的鲁棒性。
AI解读:PaddleOCR-VL-1.5是百度飞桨团队对现有文档解析模型的升级,核心价值在于用很小的 0.9B参数规模达到接近人类水平的文档识别准确率。根据官方数据,它在OmniDocBench v1.5基准上取得 94.5% 的准确率,超过之前的最佳模型;同时新增了印章识别和文本检测识别一体化(本地化+识别)功能,并支持藏文与孟加拉文。这对处理扫描件、照片文档或古籍的用户(如档案数字化、财务票据处理)意味着无需依赖超大模型也能获得更高精度,尤其在倾斜、弯折、屏幕拍照等物理畸变环境下,官方称其表现优于主流开源与商用模型。不过,这些数字是百度自测或官方榜单结果,真实效果仍取决于具体场景的文档质量;普通用户无需立即升级,但开发者可通过PaddleOCR库或Hugging Face上发布的权重进行测试。新推出的Real5-OmniDocBench基准也为行业提供了更贴近真实场景的评测方法,后续模型之间的对比将更有参考性。
百度飞桨团队发布PaddleOCR-VL-1.5,这是其文档解析视觉语言模型的升级版本,在保持 0.9B参数规模的同时,于OmniDocBench v1.5基准上取得 94.5% 的准确率,据称刷新了该榜单的SOTA记录。
新版能力与新增任务
根据百度ERNIE团队发布的技术博客,PaddleOCR-VL-1.5在表格、公式与文本识别任务上相较前代模型有显著提升,并新增了文本检测识别一体化(文本行级定位+识别)与印章识别能力,两者在同任务指标上均达到自称的SOTA水平。模型还增强了对古籍文本、多语言表格、下划线与复选框的识别,并新增藏文和孟加拉文支持。
针对长文档解析中的内容割裂问题,新版模型支持跨页表格自动合并与跨页段落标题识别。官方博客同时宣布推出Real5-OmniDocBench基准,该基准基于OmniDocBench v1.5构建,覆盖扫描、弯折、屏幕拍照、光线变化与倾斜五类真实场景,用于评测模型在现实物理畸变条件下的鲁棒性。
技术实现与推理部署
PaddleOCR-VL-1.5采用支持不规则形状定位的文档解析新范式,能够在文档倾斜、弯折等条件下进行多边形检测。官方提供多种使用方式:通过PaddleOCR的Python API或CLI进行页面级文档解析,也可启动vLLM推理服务以加速VLM推理,部署方式包括Docker(PaddleOCR方式)或vLLM官方指南。
该模型已支持通过Hugging Face transformers库(需v5.0.0及以上版本)进行推理,任务类型包括OCR、表格、公式、图表、文本检测识别一体化(spotting)和印章识别。官方注明,transformers方式仅支持元素级识别与文本检测识别一体化,而推荐使用官方推理方式以获得更快的速度与页面级解析支持。
性能数据与评测方法
官方博客列出的性能数据基于OmniDocBench v1.5官方排行榜,其中Gemini-3 Pro、Qwen3-VL-235B-A22B-Instruct与PaddleOCR-VL-1.5为独立评测结果,显示新版模型在整体指标、文本、公式、表格与阅读顺序等维度上均取得首位。在Real5-OmniDocBench上,官方称其在五类真实场景中持续刷新SOTA表现。
推理性能方面,官方公布在单张NVIDIA A100 GPU上以batch size=512 进行端到端推理,统计时间包含PDF渲染与Markdown生成。所有对比方法均使用各自默认的PDF解析模块与DPI设置,以反映开箱即用的实际性能。模型权重、代码与技术报告已公开,相关论文预印本号(arXiv:2601.21957)也已发布。