DeepSeekはこのほど、V4シリーズの最初の実験用マルチモーダルモデルである「DeepSeek-V4-Flash-Vision-Exp」を正式にオープンソース化しました。このモデルは、既存のV4-Flashの基盤アーキテクチャに視覚モジュールを深く統合し、既存の強力なテキスト処理能力に加え、画像の深い理解と分析能力を全面的に備えています。

核心技术パラメータにおいて、この実験モデルの総パラメータ数は3050億規模に達しています。視覚モジュールとテキスト構造を組み合わせることで、このモデルはさまざまな画像コンテンツを正確に解釈するだけでなく、外部ツールとシームレスに連携して複雑なエージェント(エージェント)タスクを独立して完了することも可能です。公式の評価データによると、このモデルは純粋なテキストエージェントタスクにおいては以前のV4-Flashと同等の性能を示しており、マルチモーダルの総合テストでは強力な競争力を発揮しています。実際のマルチモーダルエージェント能力は、いくつかの業界テストで目覚ましい結果を示し、業界のトップレベルに近づいています。