OvisOCR2 Technical Report
作者: Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li, Cheng Qin, Zhao Xu, Weihua Luo
分类: cs.CV, cs.AI
发布日期: 2026-07-15
🔗 代码/项目: HUGGINGFACE
💡 一句话要点
提出OvisOCR2以解决文档解析问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 文档解析 端到端模型 Markdown生成 强化学习 数据引擎 模型融合 信息提取
📋 核心要点
- 现有文档解析方法多为管道式,难以实现高效的端到端处理,导致信息提取不完整或不准确。
- OvisOCR2通过构建一个端到端的文档解析模型,能够直接从图像生成Markdown格式的文本,提升了处理效率和准确性。
- 在多个基准测试中,OvisOCR2的表现超越了传统方法,特别是在OmniDocBench和PureDocBench上取得了领先的得分。
📝 摘要(中文)
我们介绍了OvisOCR2,一个0.8B的文档解析模型。OvisOCR2被设计为一个端到端的解析器:给定文档页面图像,它生成自然阅读顺序的Markdown表示,涵盖文本、公式、表格和视觉区域。我们构建了一个数据引擎,将过滤后的真实文档注释与合成页面结合,后者的渲染图像和Markdown目标源自相同的HTML。训练过程包括监督微调、在4B分支上进行强化学习、对0.8B模型进行在线蒸馏和模型融合。在OmniDocBench v1.6上,OvisOCR2达到了96.58的最先进的整体得分,成为该排行榜上首个端到端模型,突显了端到端文档解析的潜力。在PureDocBench上,OvisOCR2也取得了75.06的最高Avg3得分。除了这两个公共基准外,我们还在一个内部基准上评估OvisOCR2,该基准旨在覆盖更广泛的长尾和挑战性场景。OvisOCR2在比较方法中表现最佳,进一步证明了其泛化能力和鲁棒性。OvisOCR2可在https://huggingface.co/ATH-MaaS/OvisOCR2获取。
🔬 方法详解
问题定义:本论文旨在解决现有文档解析方法的局限性,尤其是管道式方法在信息提取过程中的不连贯性和低效率。
核心思路:OvisOCR2采用端到端的设计理念,直接从文档图像生成Markdown表示,简化了处理流程并提高了准确性。
技术框架:OvisOCR2的整体架构包括数据引擎、监督微调、强化学习、在线蒸馏和模型融合等多个模块,形成一个完整的训练和推理流程。
关键创新:OvisOCR2的主要创新在于其多组件奖励设计的强化学习策略,以及将真实文档注释与合成页面结合的训练方法,这与传统的分步处理方法有本质区别。
关键设计:在训练过程中,OvisOCR2使用了特定的损失函数和网络结构,结合了多种数据源,以确保模型的泛化能力和鲁棒性。
🖼️ 关键图片
📊 实验亮点
OvisOCR2在OmniDocBench v1.6上取得了96.58的最高得分,首次使端到端模型在该排行榜上领先于传统管道方法。在PureDocBench上,OvisOCR2的Avg3得分达到75.06,显示出其在文档解析中的卓越性能和广泛适用性。
🎯 应用场景
OvisOCR2在文档解析领域具有广泛的应用潜力,能够用于自动化文档处理、信息提取、以及数据整理等场景。其高效的解析能力将为企业和研究机构在处理大量文档时提供显著的价值,未来可能推动相关领域的技术进步。
📄 摘要(原文)
We introduce OvisOCR2, a 0.8B document parsing model. OvisOCR2 is designed as an end-to-end parser: given a document page image, it generates a Markdown representation in natural reading order, covering text, formulas, tables, and visual regions. We build a data engine that combines filtered real-document annotations with synthetic pages whose rendered images and Markdown targets are derived from the same HTML source. The training recipe includes supervised fine-tuning, reinforcement learning on a 4B branch with a multi-component reward design, on-policy distillation into the 0.8B model, and model fusion. On OmniDocBench v1.6, OvisOCR2 achieves a state-of-the-art overall score of 96.58, placing an end-to-end model at the top of this leaderboard previously dominated by pipeline methods and highlighting the potential of end-to-end document parsing. On PureDocBench, OvisOCR2 also achieves the highest Avg3 score of 75.06. Beyond these two public benchmarks, we evaluate OvisOCR2 on an in-house benchmark designed to cover a broader set of long-tail and challenging scenarios. OvisOCR2 obtains the best overall performance among the compared methods, providing further evidence of its generalization and robustness. OvisOCR2 is available at https://huggingface.co/ATH-MaaS/OvisOCR2.