阿里云近日宣布,正式开源其最新研发的文档解析模型OvisOCR2。该模型在权威评测基准OmniDocBench v1.6中以96.58分的综合成绩打破纪录,成为首个超越传统多模型协作方案并登顶该榜单的端到端架构模型,为文档智能处理领域开辟了新的技术路径。
传统文档解析方案依赖"流水线式"架构,需串联版面分析、文字识别、表格解析等多个独立模型。这种模式不仅导致系统维护复杂度呈指数级增长,更因误差传递机制严重影响最终输出质量。OvisOCR2通过创新性的端到端设计,仅需单次推理即可将文档图像转化为符合人类阅读习惯的Markdown格式文本,完整保留原文中的文字、公式、表格及视觉元素布局信息。
基于Qwen3.5-0.8B基座模型开发的OvisOCR2,在保持仅0.8亿参数量的轻量化优势下,实现了行业领先的解析精度。其训练体系融合监督微调、强化学习、在线策略蒸馏及模型融合四大阶段,配合真实业务数据与合成数据构建的混合训练引擎,充分挖掘了紧凑型模型的性能潜力。这种设计使得模型在保持高精度的同时,推理效率较传统方案提升3倍以上。
开源版本采用Apache 2.0许可协议,已实现与vLLM等主流推理框架的无缝兼容,并可深度融入Qwen3.5生态体系。开发者能够直接调用模型处理复杂文档场景,包括但不限于学术论文解析、财务报表识别、合同要素抽取等任务。实验数据显示,该模型在多栏布局文档、手写体混合场景及跨语言文档处理中均表现出显著优势。