感谢IT之家网友 的线索投递!
IT之家在7月24日发布消息, 今日, 阿里云进行开源, 发布了文档解析模型 , 该模型凭借96.58的综合得分, 刷新了v1.6榜单的纪录, 成为首个超越流水线方法, 且登顶该榜单的端到端模型, 官方表示“这是文档解析领域迎来技术路线的重要突破”。
端到端模型首次超越流水线方法
因从官方公告得知, 文档解析属于那种大模型落地所必需的关键基础设施, 在企业知识库、RAG检索、智能问答等场景里, 都得把PDF、扫描件等非结构化文档转变为结构化文本。
在此之前, 该领域是由“流水线方法”占据主导地位的, 它一般是由版面分析模型以及内容识别模型这两部分所构成的, 其中, 前者的职责是辨别文档的布局, 而后者呢, 则是承担着对文字、公式、表格等各类内容进行识别的任务, 最终再将其进行拼接从而输出出来。这种方式固然是成熟的, 然而却存在着维护成本高昂、误差会不断累积、部署颇为复杂等一系列固有的瓶颈。
选用端到端技术路径, 输入一幅文档图像, 模型于一次生成里输出契合自然阅读顺序的表示, 涵盖文本、公式、表格以及视觉区域。以往需多个模型协作来达成的工作, 如今由一个模型一蹴而就。
于v1.6之上, 以96.58分完成登顶之举, 首次证实端到端模型能够超越流水线方法。

小参数大能力,0.8B 实现 SOTA
由Qwen3.5-0.8B这一版本经后续训练而得来, 团队搭建起了一种数据引擎体系, 该体系中真实文档与合成文档相互补充, 其中合成文档专门针对表格和公式相互交织、多栏版式以及长输出等等这般复杂的场景进行补充, 训练方案把监督微调, 也就是SFT, 强化学习, 即RL, 在线策略蒸馏, 也就是OPD, 还有模型融合这四个阶段的流程予以融合, 从而形成了一种多阶段递进式的训练流程, 借此充分释放出紧凑模型的潜力。
数据引擎体系项目已开源发布,无缝融入千问生态
凭借 2.0 许可证予以开源, 对 vLLM 等主流推理框架具备兼容性, 同 Qwen3.5 推理生态形成衔接, 开发者在无需进行额外适配的状况下就能够实现集成。
模型获取方式
相关标签: # OvisOCR2 # 端到端模型 # 文档解析 # 流水线方法 # 开源模型