阿里巴巴旗下 Qwen 團隊近日發佈新一代原生全模態模型 Qwen3.8-Omni-Flash,把音頻、視頻理解與 AI 智能體能力進一步擰到了一起。它支持文本、圖像、音頻和視頻四種輸入,並提供100萬 Token 上下文窗口;與上一代 Qwen3.5-Omni-Plus 相比,官方稱其在29項基準測試中的平均成績提升超過25%。

這次最大的變化不是堆能力,而是處理方式:它不是把語音識別、圖像識別簡單拼接,而是從模型層面原生處理不同類型的信息。阿里的意圖很明確——讓模型不只是"看懂"或"聽懂"音視頻,還能在理解之後規劃任務、調用工具、把活幹完。

image.png

音頻是它最鋒利的一面。在 WildClawBench-MM 多模態工具調用測試中,Qwen3.8-Omni-Flash 拿下71.0分,Gemini3.8Flash 爲58.9分;DailyOmni 上85.1對84.0;SpotSoundBench 上67.2對39.7;MMAU 上81.8對76.9,四局全勝。多說話人會議識別的進步更是誇張:AliMeeting 測試中,說話人錯誤率 DER 從上一代的88.11驟降到3.35,帶說話人歸屬的詞錯誤率 cpWER 從89.61降到17.18。不過它並非全面領先——AgenticVBench 上 Gemini3.8Flash 拿45.0分、Qwen 爲36.8分,OmniGAIA 上則是78.6對74.0,部分視頻理解測試裏 Gemini 同樣佔優,所以"逼近 Gemini"主要體現在整體音頻和音視頻能力上。

真正可能改寫使用方式的是價格。Qwen 稱音頻輸入的估算成本每小時下降超過98%,音頻加視頻輸入每小時下降超過93%——按官方口徑,每小時成本以兩分鐘素材的處理價乘以30計算,視頻按720p、每秒1幀輸入。阿里雲公佈的國際區域定價爲每百萬 Token 輸入0.15美元、命中緩存的輸入 Token0.016美元、每百萬輸出 Token0.47美元,中國大陸及部分區域價格另有不同。

配合100萬 Token 上下文窗口(最大輸入接近99.2萬,思考模式下約98.4萬,最大輸出13.1萬),開發者可以把超大規模的音頻或視頻直接塞給模型,不用再頻繁切片、抽幀、串多個模型。模型還能處理113種語言和方言的音頻輸入,支持雙聲道立體聲和四聲道空間音頻分析,並提供函數調用、聯網搜索和上下文緩存。

應用方向上,Qwen 團隊這次主打"智能體交付":模型能分析長視頻、定位關鍵內容,再調工具完成視頻編輯、內容整理、會議總結和字幕生成。配套方面已公佈面向多模態智能體開發的 Qwen-MM-Plugins,並計劃推出 Qwen-Live-Harness。目前 Qwen3.8-Omni-Flash 通過阿里雲百鍊提供服務,覆蓋北京、新加坡、中國香港、日本東京、德國法蘭克福和美國弗吉尼亞等區域;模型本身未直接開放權重,此次主要開放配套的多模態插件和開發工具。

超過98% 的音頻成本降幅一旦兌現,長時間會議錄音、播客、直播和海量視頻素材的自動分析將變得前所未有的便宜,Qwen 與 Google Gemini 在多模態賽道上的貼身纏鬥,也會因此再升一級。