7月24日、アリババは0.8Bパラメータ規模のドキュメント解析モデル「OvisOCR2」をオープンソースとして公開しました。権威あるドキュメント解析ベンチマーク「OmniDocBench v1.6」での評価において、このモデルは96.58という総合スコアでトップに立ち、従来のフローチャート方式を初めて完全に上回るエンドツーエンドのドキュメント解析モデルとなりました。これはドキュメントインテリジェンス技術分野における画期的な范式の転換を示しています。

QQ20260724-140219.jpg

RAG検索、スマート質問応答および企業知識ベースの主要なインフラストラクチャであるドキュメント解析は、長年「レイアウト分析+コンテンツ認識」のフローチャートによる連携形式で行われてきましたが、保守コストが高く、誤差が段階的に累積し、導入が複雑であるなどの課題がありました。Qwen3.5-0.8Bに基づいて後学習されたOvisOCR2はこれらの制約を突破し、単一モデルで一度に生成することで、自然な読解順序に沿ってテキスト、数式、表、視覚領域を含むMarkdown形式で出力することが可能です。

技術的な実装では、本モデルは現実的データと合成データを補完する手法を組み合わせ、監督微調整(SFT)、強化学習(RL)、オンライン戦略蒸留(OPD)およびモデル統合の4つの手段を通じて、コンパクトなモデルの潜在力を十分に引き出しています。

現在、OvisOCR2はApache 2.0ライセンスに基づきHugging Faceおよび魔搭コミュニティで全面的にオープンソース化されており、vLLMなどの主要な推論フレームワークと互換性があります。千問エコシステムにスムーズかつ無感覚に統合可能です。小パラメータながら高性能なデプロイの利点により、このモデルの登場により高精度ドキュメント解析のVRAMおよび計算能力の門檻が大幅に低下し、ドキュメントインテリジェンスは複雑なシステム工学からより簡潔な効率的なモデル駆動型への進化を推進しています。