アリは新世代の画像生成基礎モデル「Qwen-Image-3.0」を正式に発表しました。これは「千問」画像生成および編集シリーズの第3世代のベースモデルであり、最大4.5Kトークンの超長テキスト入力をサポートし、数式や記号、図形、論理的導出、複雑なUIインターフェースなどを含むコンテンツを一度に生成できます。また、12言語と20種類以上のフォントのレンダリングをネイティブにサポートしており、商業用のテキストと画像の作成能力をさらに向上させています。

QQ20260721-151544.jpg

前世代モデルと比較して、「Qwen-Image-3.0」ではテキスト入力長が4.5倍に拡大され、映画の分鏡、知識図解、製品説明ページなど、長いプロンプトが必要なシーンにおいて、ユーザーは必要を圧縮する必要がなく、設計ドキュメントのように画面構造、文章内容、ビジュアルスタイル、レイアウトの詳細を完結に記述できます。これにより、より正確な生成結果を得ることができ、繰り返しの修正や手動調整のコストを削減します。

複雑なコンテンツ理解に関して、「Qwen-Image-3.0」はセマンティック解析と空間配置能力を強化し、複数のテーマをカバーする九宮格の知識図解を一度に生成できるようになります。また、文字の明確さと内容の正確性を両立し、複雑なロジックのネストもサポートしています。単一の指示でウェブページ、ソフトウェアインターフェース、チャット窓、ポスターなどの複数の視覚要素の組み合わせを生成できます。例えば、「VSCodeプログラミングインターフェース内で、千問アプリを使ってチャット画面に掲載するコーヒーのポスターを作成する」といった複雑なシナリオにおいて、モデルは複数のUI関係を正確に理解し、すべてのインターフェースのスタイルを一貫させます。また、約10ピクセルの小さな文字サイズでも明確に表示することが可能です。

QQ20260721-151554.jpg

公式によると、「Qwen-Image-3.0」は肖像写真、数学の問題紙、古代碑文の拓片、ライブ配信ページなどの場面で高い細部の再現能力を持っており、複雑なテキストと画像の混在や高密度の情報の持ち込みを重点的に最適化しています。

生成型AIが徐々に専門的なデザインや商業的なコンテンツ制作の分野に進出する中、画像モデルの競争は基本的な画質から複雑な情報表現、読みやすさ、およびエンジニアリング能力へと移行しています。「Qwen-Image-3.0」のリリースにより、AI画像生成は高精度、多言語、および商用利用可能な方向へさらに推進されます。