7月24日,阿里巴巴宣佈開源發佈僅0.8B參數規模的文檔解析模型OvisOCR2。在權威文檔解析基準OmniDocBench v1.6評估中,該模型以96.58的綜合得分登頂,成爲首個全面超越傳統流水線方法的端到端文檔解析模型,標誌着文檔智能技術領域迎來突破性範式轉折。

作爲RAG檢索、智能問答與企業知識庫的核心基礎設施,文檔解析長期由“版面分析+內容識別”的流水線串聯模式主導,面臨維護成本高、誤差逐級累積及部署複雜等瓶頸。基於Qwen3.5-0.8B後訓練的OvisOCR2突破了上述限制,僅憑單模型一次生成即可按自然閱讀順序輸出包含文本、公式、表格與視覺區域的Markdown表示。
在技術實現上,模型結合真實與合成數據互補的技術路徑,並通過監督微調(SFT)、強化學習(RL)、在線策略蒸餾(OPD)及模型融合四大手段充分釋放緊湊模型的潛力。
目前,OvisOCR2已基於Apache2.0協議在Hugging Face及魔搭社區全面開源,兼容vLLM等主流推理框架,可無縫無感接入千問生態。憑藉小參數高效能的部署優勢,該模型的推出大幅降低了高精度文檔解析的顯存與算力門檻,推動文檔智能從複雜的系統工程向更簡潔的高效模型驅動演進。
