泰文OCR新模型Wayu-Paxa-OCR-Zero:仅用合成数据训练,手写识别字符错误率降至20.55%
泰国研究人员通过解耦合成数据中的“真实感”因素,发现字体多样性、二维结构和真实手写字形是提升迁移效果的关键;基于此微调的0.9B参数模型在印刷泰文上字符错误率降至1.24%,优于7B规模的Typhoon OCR。
AI解读:泰文OCR一直受限于真实标注数据稀缺,而合成数据虽能无限生成精确标签,却常因与真实文档差异过大导致模型迁移效果不佳。这篇arXiv论文通过逐项拆解“页面背景、字体、版式、字形”等因素,首次明确:非文本背景作用不大,真正影响迁移的是字体多样性、二维版面结构和真实手写字形——这为合成数据设计提供了可操作的指南。基于此,研究者用45,723张合成页面微调0.9B参数的PaddleOCR-VL-1.6,得到Wayu-Paxa-OCR-Zero:印刷泰文的中位字符错误率从6.64%降至1.24%,手写从74.87%降至20.55%,并在五个测试集上全面超过7B规模的Typhoon OCR v1 7B。对要开发低资源语言OCR的团队,含义是:不必强求合成图像“看起来真实”,应优先覆盖字体、版面排列和真实手写笔画;但需注意,测试集与训练页面同域,跨域泛化(论文中crop级训练下错误率15.59%对5.52%)仍是短板,实际落地需结合少量真实样本或域适应。普通用户无需立即行动,该模型尚未发布可用的API或权重。
一篇arXiv技术报告(编号2609.03595,2026年9月3日提交)研究合成OCR标注向真实泰文文档迁移的条件,并据此构建了泰文OCR模型Wayu-Paxa-OCR-Zero:在不使用任何真实泰文页面OCR标签的情况下,通过45,723张合成页面微调0.9B参数的PaddleOCR-VL-1.6。相比原检查点,该模型在印刷页上的中位字符错误率从6.64%降至1.24%,手写页从74.87%降至20.55%,并在全部五个评估集上优于7B规模的Typhoon OCR v1 7B。报告作者为Kunat Pipatanakul。
合成数据各因素对迁移效果的影响
为厘清合成数据中“真实感”究竟指什么,作者使用受控的文档重建管线,逐一变化页面背景、版式、排版、空间结构和字形,并在整页与裁剪两种训练粒度下评估印刷与手写泰文文档的识别效果。结果表明:非文本背景几乎没有一致影响;字体多样性、二维版面结构以及真实手写字形才是提升迁移的主要因素。
源域匹配效果取决于训练粒度。在整页训练下,域内重建的合成数据接近使用真实印刷监督(中位字符错误率1.82%对比1.31%);但在裁剪训练下,域内重建明显不如域外重建(15.59%对比5.52%)。