微軟於 7 月 23 日宣佈推出兩款自研AI模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash,均已進入公開預覽階段。兩款模型分別面向高質量圖像生成與高併發語音交互場景,微軟強調其訓練數據經過清理和可追蹤,不依賴第三方模型蒸餾,從底層設計就直接服務於微軟產品用戶。

image.png

圖像模型精度最高,GPU成本最高降84%

MAI-Image-2.5-Pro是微軟目前精度最高的圖像模型,面向主視覺圖片生成、細節編輯及圖像內文字渲染等高要求場景,支持自然語言編輯指令。該模型已在Bing Image Creator中成爲默認圖像生成模型,在PowerPoint中用於圖像到圖像編輯功能,與GPT-Image- 2 相比可降低最高84%的GPU成本。在OneDrive中部署後,相關場景保存成功率提升26%,P95 延遲降低約25%,中等負載生產環境效率提升2. 5 倍。

定價方面,文本輸入每百萬Token收費 5 美元,圖像輸出每百萬Token收費 106 美元。

語音模型速度提升 2 倍,已服務T-Mobile等客戶

image.png

MAI-Voice-2-Flash針對高頻語音應用優化,相比上一代速度提升約 2 倍,成本降低32%,適用於客服中心和語音助手等快速響應場景。該模型已接入Dynamics 365 Contact Center,爲T-Mobile、EasyJet等客戶提供服務,GPU成本最高降低89%。微軟還將其集成至Azure Voice Live服務,支持開發者構建語音到語音交互智能體。

此外,同系列的MAI-Transcribe-1. 5 已應用於醫療語音解決方案Dragon Copilot,被 17 萬名醫療服務提供者使用,上季度處理 2800 萬次患者問診記錄,支持 58 種語言,多數語言轉錄錯誤率相對下降50%。微軟透露下一代GB200 計算集羣已投入運行,MAI系列模型將持續擴展。