千問於18日上線新一代原生全模態模型 Qwen3.8-Omni-Flash,支持文本、圖像、音頻與視頻輸入及1M 長上下文,已在千問 AI 平臺開放體驗。該模型在此前編程、文本知識工作與 GUI 操作等通用 Agentic 能力之上,着重拓展以音視頻爲核心的 Agentic 應用,覆蓋視頻剪輯、MV 創作、影視製作與解說、音視頻轉圖文摘要及音視頻對話等需綜合處理多模態內容的工作流。

QQ20260918-112424.jpg

在累計30項評測中,其平均得分較上一代 Qwen3.5-Omni-Plus 提升超26%。音視頻 Agent、Coding 與長程任務方面,WildClawBench-MM 提升36.5分,AgenticVBench 提升22.3分,UniClawBench 取得69.6分;基礎能力上,LongAudioSpan 提升8.3分,OmniVideoBench 提升9.6分,OmniCap-IF 的 CSR/ISR 分別提升8.5/14.1分,AliMeeting 的 DER/cpWER 由88.11/89.61降至3.35/17.18。

QQ20260918-112432.jpg

官方稱其音視頻能力接近 Gemini3.8Flash,音頻能力整體超過後者;API 每小時音頻輸入價格降幅超98%,音視頻輸入價格降幅超93%。

爲支撐長程工作流與實時交互,千問擴展了 Qwen-MM-Plugins 並開源 Qwen-Live Harness。在 Agentic Understanding 模式下,OmniVideoBench 準確率由63.4升至67.8,Token 消耗從145,736降至79,117,降幅約45.7%。

QQ20260918-112441.jpg

團隊還將模型推向研發環節本身:12小時內自主完成評測集選擇、數據構建與4輪迭代,累計構建3,413條訓練數據,將 Qwen2.5-Omni-3B 的四川話識別字符錯誤率從25.79% 降至15.30%,相對下降約40.7%。同步推出的 Realtime 版本爲首個支持"聽聲辨位"的全模態大模型。