語音交互領域迎來里程碑式突破!國內AI公司階躍(Step Audio)近日震撼開源了一款



語音交互領域迎來里程碑式突破!國內AI公司階躍(Step Audio)近日震撼開源了一款


OpenAI宣佈ChatGPT移動端新增語音智能體功能,用戶說話即可撰寫文檔、總結郵件等。Pro和Plus用戶可創建文檔、郵件、總結Slack消息,並執行建站、做PPT、使用雲端瀏覽器等進階操作;Free和Go用戶可用插件及已連接應用。語音對話將提供更豐富文本輸出。
OpenAI在ChatGPT移動端全面引入語音智能代理功能。用戶不僅可用語音閒聊,還能通過口頭指令指揮AI跨外部應用和工具,在後臺自主執行多步驟複雜任務,推動移動端AI交互迎來顛覆式變革。
OpenAI推出全雙工語音模型GPT-Live-1,採用單一模型架構取代傳統“語音轉文字—推理—文字轉語音”級聯流程,顯著降低延遲,實現類人流暢交互。該模型已上線API,面向開發者,能更穩健應對停頓、打斷和話題轉換等複雜對話場景。
谷歌爲Workspace推出基於Gemini的AI語音功能,深度整合Gmail、Google Docs和Keep。用戶可用自然語音完成郵件檢索、文檔起草和結構化筆記整理,擺脫手動打字,提升多任務辦公效率,Docs文檔處理迎來顛覆性語音升級。
OpenAI在ChatGPT中測試新型語音模型Bidi 1,用戶已在網頁及App端發現。它打破傳統線性問答模式,支持實時打斷與插話,實現更自然流暢的雙向對話,預示語音交互的“降維打擊”式進化,公司正籌備更大規模測試。