商湯テクノロジーは、コミュニティ向けに軽量な統合マルチモーダルモデル「SenseNova U1.5-Lite-Preview」をオープンソースとして発表しました。このモデルは単なる規模の拡大ではなく、SenseNova U1のシステム的なアップデートであり、同じアーキテクチャの中で視覚理解、推論、生成、編集の4つの能力を統合しています。
特に注目すべきはその軽量なサイズです。8B-MoEのパラメータ規模で、4K解像度、より細かいリアルな質感、そしてより複雑な視覚制御が実現されています。商湯は、U1が統合アーキテクチャの実現可能性を検証したとし、U1.5はさらに能力の拡張が可能であることを証明するものだと述べています。

4つの方向で顕著な向上、生成と編集の全プロセス最適化
U1と比較して、U1.5-Lite-Previewは4つの主要な方向で顕著な向上を遂げています。4K画像生成のネイティブサポート、より細かい部分のテクスチャと現実世界の質感、正確な中英文のテキスト生成と複雑なレイアウト構成、およびより安定した画像編集と視覚指示の遵守です。
技術的な詳細において、商湯はグリッドのノイズや高解像度のディテールモデリングの問題に対して、生成ヘッドを再設計し、最終的な画像への視覚トークングリッドの影響を弱め、トレーニングを4K解像度に拡張しました。画像編集に関しては、モデルは編集データとトレーニングタスクを再構成し、元画像の内容、主体のアイデンティティ、空間構造、および編集されていない領域の保持能力を強化しました。これにより、目標の変更を行う際には、元画像で変更が必要ない部分をできるだけ保持することが保証されます。
複数のベンチマークテストでの大幅な向上、特に編集能力が突出
評価結果は今回の最適化の実際的な効果を示しています。Qwen-Image-Benchは47.14から55.20(プロンプトの強化を伴う)へと上昇し、ImgEdit-Benchは3.90から4.37へ、GEdit-Benchの英語版は7.47から8.17へ、中国語版は7.42から8.05へと上昇しました。全体的に見ると、生成品質と編集の安定性は明らかに向上しており、特に画像編集における指示の遵守と元画像の保持において進歩が顕著です。
