Jina AI发布Jina-OCR-v1:面向低预算GPU的端到端文档解析模型
模型结合DeepSeek-OCR视觉编码器与 3B MoE解码器,在OmniDocBench上得分 91.14,吞吐率达每秒 2.57 页;在NVIDIA L4上通过推测解码将速度提升一倍。
AI解读:Jina AI推出Jina-OCR-v1,目标是在低预算GPU上高效解析文档。模型复用了DeepSeek-OCR的压缩视觉编码器和 3B参数的混合专家解码器(每次token激活约 5.7 亿参数),并加入自研的FastMTP推测解码头,在NVIDIA L4这类入门级GPU上可将解码速度提升一倍。对设备有限的开发者来说,这意味着可以在更便宜的显卡上运行高精度文档解析,而不是必须依赖高端硬件。模型的性能数据来自基准测试(OmniDocBench 91.14分、olmOCR-Bench 83.4分),并实现了对比中最高的吞吐率(每秒 2.57 页),但实际速度会受文档复杂度和硬件影响。当前模型已在Hugging Face公开,使用者可以直接下载测试,但需注意其训练部分依赖合成数据,真实场景效果可能因文档类型而异。
Jina AI的研究团队发布了Jina-OCR-v1,一个基于DeepSeek-OCR架构构建的端到端文档解析模型,专为低预算GPU设计。在默认动态分辨率设置下,该模型在OmniDocBench v1.6基准上取得 91.14 分,在olmOCR-Bench上取得 83.4 分,并达到对比中最高的页面吞吐率:每秒 2.57 页。
模型架构与关键技术
Jina-OCR-v1结合了DeepSeek-OCR的压缩视觉编码器和 3B混合专家(MoE)解码器,后者每个token激活约 5.7 亿参数。模型加入了FastMTP推测解码头,该解码头在K=3 个预测步骤中递归共享一个草案块,并通过贪婪验证保证无损解码。
后训练阶段结合了指令对齐、在困难文档上的鲁棒性微调,以及基于密集可验证奖励的GRPO方法。这些奖励包括确定性公式、表格和结构检查,为部分正确的结果提供部分得分。训练数据混合了清理后的公共语料库和有针对性的合成页面。
性能与可用性
在NVIDIA L4这类低预算GPU上,FastMTP推测解码可实现比贪婪自回归解码快两倍的解码速度。论文中报告了基准测试得分和吞吐率数据。
该模型已公开发布,可访问https://huggingface.co/jinaai/jina-ocr-v1。相关论文以arXiv:2609.03181 发布,作者包括Alejandro Barón García、Feng Wang、Emilia Garcia Casademont和Han Xiao。