商湯科技は新しく軽量でネイティブな統一マルチモーダル大規模モデル「SenseNova U1.5Lite」をオープンソース化することを正式に発表しました。パラメータ数が8Bの軽量モデルとして、いくつかの重要なビジュアルタスクにおいて同サイズのモデルを上回る実力を示しており、一部の複雑なレイアウトやテキストレンダリングでは超大規模な商業モデルと同等の成果を達成しています。

SenseNova U1.5Liteはネイティブで3~4Kのコンテキスト長さをサポートし、主体、数量、空間関係、テキスト、レイアウト、スタイルなどの複数の制約を同時に処理できるため、複雑なビジュアルタスクの実行時の安定性を著しく向上させます。
具体的な機能特性において、このモデルは複数の重要なアップグレードをもたらします。まず第一に、より高品質なビジュアル生成で、全体構図、色調、素材、光と影、現実感、局所的な細部において顕著な改善が見られ、従来モデルでよくある局所的には正しいが全体としては完成度が低い問題を効果的に回避できます。第二に、より信頼性の高いネイティブな画像編集能力で、主体のアイデンティティ、空間構造、レイアウト関係、編集対象外領域の保持度を強化し、局所的な修正、要素交換、テキストの精査、複数参照画像での編集の総合的なパフォーマンスを全面的に向上させています。

また、このモデルはテキストと複雑なレイアウトの処理においても優れた性能を発揮しており、中国語・英語のテキスト、ポスター、インフォグラフィック、ブランドビジュアル、多言語レイアウトの能力を強化し、生成コンテンツを完璧なビジュアル表現へと推進しています。ビジュアルコントロールにおいては、バウンディングボックス、ビジュアルマーカー、単一画像、複数画像の参照など、さまざまな方法をサポートしており、指定された領域やオブジェクトに対してより正確な編集が可能です。さらに注目すべきは、ネイティブで4Kの高解像度出力が可能であり、高解像度生成において全体的な構図と極めて細かい質感、小さな文字、光の屈折効果を両立できることです。
プロジェクトのアドレス:https://github.com/OpenSenseNova/SenseNova-U1
VIP会員