做文档 OCR 的同学应该深有体会:一张带表格、公式、多栏排版的扫描页,传统做法要排版分析→文字识别→表格重建→公式转 LaTeX……四五个模型串起来,哪个环节出问题都得回去排查。最近阿里云开源了一个叫 OvisOCR2 的模型,0.8B 参数,给一张图就吐出 Markdown,端到端,不用管中间过程。
是什么
OvisOCR2 是阿里云 ATH-MaaS 团队开源的 端到端文档解析模型。输入文档页面的图像,直接输出按自然阅读顺序组织的 Markdown——文本、公式、表格、视觉区域全部一次性搞定。
它基于 Qwen3.5-0.8B 后训练而来,参数量仅 0.8B,约 1.7GB 的模型文件。在 OmniDocBench v1.6 榜单上,OvisOCR2 以综合得分 96.58 登顶,成为第一个超越传统流水线方法的端到端模型。
为什么值得关注
文档解析领域之前一直是 流水线方法 的天下。一张文档图进来,先拿去版面分析,分好文本框和区域;再送去 OCR 识别文字;表格区走专门的表格重建模型;公式区走 LaTeX 识别……四五个模型串在一起,各有各的误差,累积到最后结果经常惨不忍睹。
OvisOCR2 用的是一步到位的 端到端架构:一张图片进去,一个模型出来。训练上它走了四阶段流程——监督微调→强化学习→在线策略蒸馏→模型融合,并且构建了真实文档与合成文档互补的数据引擎,让 0.8B 的小模型能榨出这么大的能力。
成绩单
在 OmniDocBench v1.6 上 OvisOCR2 是已公开模型里最高的:
| 模型 | 参数量 | 综合得分 |
| OvisOCR2 | 0.8B | 96.58 |
| PaddleOCR-VL-1.6 | 0.9B | 95.77 |
| MinerU2.5 | 1.2B | 95.56 |
| HunyuanOCR | 1B | 93.64 |
得分最高的同时,OvisOCR2 还是榜单前排里参数最小的那个。0.8B 在一众 1B 左右的模型里属于轻量级选手。
怎么用
OvisOCR2 已全面兼容 vLLM,可以用 OpenAI 兼容的方式部署:
# 用 transformers 推理
from transformers import AutoModelForCausalLM, AutoProcessor
model = AutoModelForCausalLM.from_pretrained(
"ATH-MaaS/OvisOCR2",
trust_remote_code=True
)
processor = AutoProcessor.from_pretrained(
"ATH-MaaS/OvisOCR2",
trust_remote_code=True
)
# 输入文档图片,输出 Markdown
inputs = processor(images=["doc_page.png"],
text="Extract the document content as Markdown.",
return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=4096)
print(processor.decode(output[0], skip_special_tokens=True))
也可以一键部署 vLLM 服务端,用 OpenAI Python SDK 调用。Qwen3.5 生态的 Pipeline 完全兼容,用起来很顺手。
不是没有槽点
公式识别还有提升空间。 OmniDocBench 上的公式 CDM 得分是 97.5,比 PaddleOCR 的 98.0 略低。论文自己也提了这个问题——大约有 22/2352 个公式存在分割误差。低分公式只有零散几个,但做学术论文 OCR 的话可能会踩到。
吞吐量一般。 目前只支持 eager 模式,不支持 cudagraph 加速。实测一张 W7900 跑完 1651 页的测试集大约需要 1 小时,单页延迟不算拉胯,但批量场景下跟 PaddleOCR 的流水线方案比还有差距。
中文文档表现。 虽然模型基于 Qwen3.5 训练(对中文原生支持),但 OmniDocBench 评测集本身以英文为主。中文排版(竖排、古籍、双栏混排)的真实表现建议自己跑几页看看。
跟同类怎么比
对比 PaddleOCR-VL-1.6: 百度的 OCR 一直是这块的老大,流水线方案成熟、中文优化好。OvisOCR2 的综合得分虽然更高,但 PaddleOCR 的公式识别更强、推理优化更到位。如果你是纯表格+公式场景,PaddleOCR 可能更稳。
对比 MinerU2.5: MinerU 的优势是精度高 + 文档预处理做得好,1.2B 参数换来了更好的版面分析能力。但模型体积大了一倍,部署成本更高。
我的建议:手里有 GPU 想跑文档 OCR,OvisOCR2 是目前开箱即用的好选择——轻量、开源、端到端,不用折腾串模型。如果你需要极致公式精度,可以等 Ovis 后续更新或搭配 PaddleOCR 做二次校正。
GitHub(ROCm 移植版):AIwork4me/OvisOCR2-ROCm
HuggingFace 模型:ATH-MaaS/OvisOCR2
原始项目:ATH-MaaS/Ovis ⭐1.5K
技术报告:arXiv 2607.13639
标签:#OvisOCR2 #阿里云 #OCR #文档解析 #端到端 #Qwen3.5 #OmniDocBench
关注我,每期分享一个帮你省事的强大工具 🛠️