9月21日,通義千問團隊正式開源新一代圖像模型 Qwen-Image-2.1。該模型以僅7B 參數的輕量視覺生成模塊,將文生圖、透明圖像生成與多種圖像編輯能力整合於同一框架,在生成效果、推理效率與使用成本之間取得了新的平衡。

QQ20260921-090605.jpg

據官方介紹,Qwen-Image-2.1的視覺生成部分採用32層 Single-Stream DiT 結構,參數量僅爲7B。通過混合粒度注意力結構與 KV Cache 複用機制,模型在多圖輸入場景下的推理效率顯著提升,顯存開銷也得到有效控制。

透明圖像生成是本次更新的核心亮點之一。模型能夠根據提示詞自動判斷輸出普通圖像或帶透明通道的 RGBA 圖像,並支持在保留透明背景的前提下進行主體表情修改、文字編輯等操作。用戶還可輸入真實照片,由模型自動提取主體並輸出透明圖層,方便後續設計與合成。

QQ20260921-090622.jpg

可以在保留透明背景的同時修改主體表情

QQ20260921-090628.jpg

透明圖層中的文字同樣可以進行編輯,如下面的示例將文字“BLOOM”修改爲“Qwen-Image”:

在圖像編輯方面,Qwen-Image-2.1支持最多10張參考圖輸入,可綜合多個主體與素材生成協調畫面。局部編輯支持圈選、塗抹和獨立掩碼三種方式,編輯區域指定更加靈活。模型還重點提升了人像與商品的一致性——修圖後人物面部特徵、商品文字與形態均能保持高度還原。

此外,模型在文字渲染、人物光影與細節刻畫上也有明顯提升,覆蓋全景圖、信息圖、分鏡圖等多種任務場景。目前,Qwen-Image-2.1已同步在 GitHub、ModelScope 和 Hugging Face 等平臺開源,供開發者與創作者免費使用。