阿里正式發佈新一代圖像生成基礎模型Qwen-Image-3.0。作爲千問圖像生成與編輯系列的第三代基礎模型,新模型支持最高4.5K Token超長文本輸入,可一次性生成包含公式符號、幾何圖形、邏輯推導、多層UI界面等複雜內容,並原生支持12種語言和20餘款字體渲染,進一步提升商業級圖文內容生成能力。

QQ20260721-151544.jpg

相比上一代模型,Qwen-Image-3.0將文本輸入長度提升至4.5倍,在影視分鏡、知識圖解、產品說明頁等依賴長提示詞的場景中,用戶無需壓縮需求,可像撰寫設計文檔一樣完整描述畫面結構、文案內容、視覺風格和版式細節,從而獲得更加精準的生成結果,降低反覆修改和人工調試成本。

在複雜內容理解方面,Qwen-Image-3.0進一步強化了語義解析和空間佈局能力,能夠一次生成覆蓋多個主題的九宮格知識圖解,兼顧文字清晰度與內容準確性。同時,模型支持複雜邏輯嵌套,可根據單條指令生成網頁、軟件界面、聊天窗口、海報等多層視覺元素組合。例如,在“VSCode編程界面中,通過千問App生成一張發佈在聊天界面的手衝咖啡海報”等複雜場景下,模型能夠準確理解多層UI關係,並保持各級界面風格一致,甚至對約10像素的小字號文字也能實現清晰呈現。

QQ20260721-151554.jpg

官方表示,Qwen-Image-3.0在人像攝影、數學試卷、古碑拓片、直播頁面等場景均具備較強的細節還原能力,對複雜圖文混排和高密度信息承載進行了重點優化。

隨着生成式AI逐步進入專業設計和商業內容生產環節,圖像模型的競爭正從基礎畫質轉向複雜信息表達、可讀性和工程化能力。Qwen-Image-3.0的發佈,進一步推動AI圖像生成向高精度、多語言和商業可用方向發展。