7月31日,阿里通義千問正式發佈語音識別大模型Qwen-Audio-3.0-ASR-Flash,主打"長音頻不丟詞、行業詞不用教",已在阿里雲百鍊平臺開放調用。
新模型在五大維度實現升級:
一是長音頻上下文記憶,轉寫時可參考前文語義,幾小時會議中的人名、技術概念全程保持一致,告別跨片段"斷片";
二是內置多行業詞庫,醫療場景專業詞召回率達95.36%,IT編程達91.87%,無需人工配置即可精準識別冷門術語;
三是分級熱詞定製,企業專屬詞彙即時生效,多數場景召回率突破99%,不因熱詞增多而誤觸發;四是集成語音潤色,一步完成去口頭禪、清理重複、處理自我糾正和語義重組,輸出可讀性接近"ASR+大模型潤色"兩步方案;
五是一套模型覆蓋30餘種語言,七語種平均語義錯誤率17.09%,優於Azure、Gemini等同業模型,適配跨國會議和出海客服場景。
同步推出的Qwen-Audio-3.0-ASR-Streaming面向實時場景,理論出字延遲300毫秒,中文工業場景錯字率7.80%,英文11.52%,領跑行業。該系列此前已在Artificial Analysis評測中以1.7%錯字率拿下全球第一,廣泛應用於會議紀要、實時字幕、教育錄播、智能客服等領域。
