9月21日、通義千問チームは新世代の画像モデル「Qwen-Image-2.1」を正式にオープンソース化しました。このモデルはわずか7Bパラメータの軽量な視覚生成モジュールを備え、テキストから画像生成、透過画像生成、およびさまざまな画像編集機能を一つのフレームワークに統合し、生成効果、推論効率、使用コストの間に新たなバランスを達成しています。

公式によると、Qwen-Image-2.1の視覚生成部分は32層のSingle-Stream DiT構造を採用しており、パラメータ数はわずか7Bです。混合粒度のアテンション構造とKV Cache再利用メカニズムにより、マルチ画像入力のシナリオでの推論効率が顕著に向上し、GPUメモリの消費も効果的に制御されています。
透過画像生成は今回のアップデートのコアとなる特徴の一つです。モデルはプロンプトに基づいて出力が通常画像またはアルファチャネルを持つRGBA画像であるかどうかを自動的に判断でき、透過背景を保持したまま主体の表情変更やテキスト編集などの操作が可能です。ユーザーは実際の写真を入力し、モデルが主体を自動的に抽出して透過レイヤーを出力することができ、後続のデザインや合成に便利です。

透過背景を保持したまま主体の表情を変更できます

透過レイヤー内のテキストも編集可能です。以下の例では、「BLOOM」から「Qwen-Image」というテキストに変更しています:
画像編集に関して、Qwen-Image-2.1は最大で10枚の参照画像の入力をサポートし、複数の主体と素材を統合して調和した画像を生成することができます。局所的な編集には選択範囲、塗りつぶし、独立したマスクの3つの方法が利用でき、編集領域の指定がより柔軟になります。モデルは人物と商品の一貫性を重点的に向上させました。修正後の人物の顔の特徴や商品の文字や形状は高い正確さで保持されます。
VIP会員