人工智能的移動端交互方式正在迎來一次顛覆式的變革。OpenAI 近期正式宣佈,在其 ChatGPT 移動應用中全面引入基於語音的智能代理(Agent)功能。這意味着,用戶未來在使用手機時,不僅可以像過去一樣通過語音與 AI 進行日常閒聊,更能夠直接通過口頭指令指揮 AI 穿梭於各種外部應用和工具之間,在後臺自主執行跨步驟的複雜實際工作。
從核心功能來看,此次更新將 ChatGPT 此前在桌面端備受好評的 Work 核心能力完整移植到了手機端。針對 Plus 和 Pro 訂閱用戶,手機端的 Work 標籤頁現在可以直接用於創建文檔、起草電子郵件以及總結 Slack 消息等高頻辦公任務;同時,它還支持進一步擴展至更復雜的應用場景,例如開展網站建設、製作演示文稿、調用雲端瀏覽器甚至是處理各類財務相關的複合型任務。而對於 Free 和 Go 用戶,OpenAI 則重點開放了對各類插件以及已連接外部應用的支持,確保不同層級的用戶都能享受到智能工具帶來的效率躍升。
在交互體驗與底層邏輯上,全新的移動端更新對語音模式進行了全方位的深度優化。在交流過程中,用戶不僅能夠聽到流暢的語音迴應,還可以在屏幕上同步看到更加完整、清晰的文本輸出信息。對於 Plus 訂閱用戶而言,應用界面提供了更加便捷的無縫切換機制,允許用戶在文字和語音模式之間自由跳轉,而不必繁瑣地結束當前對話再重新開始。此外,跨設備的連續工作能力也讓整個流程變得無比順暢:用戶完全可以在通勤或外出的碎片時間裏,通過手機語音向 ChatGPT 下達任務指令,隨後回到電腦前繼續查看和收尾,實現多端協同的無縫銜接。
回顧其技術演進軌跡,這一功能升級並非偶然。今年7月,OpenAI 推出了全新的 GPT-Live 語音模型,重點突破了自然對話、打斷處理以及連續交流的技術瓶頸,隨後迅速將其下放到桌面端,賦能 Codex 軟件開發和桌面智能代理。而此次向移動端的延伸,標誌着 OpenAI 正在重新定義手機應用的功能定位——過去主要承擔問答與搜索的“對話框”,如今已經正式演變爲能夠調度外部工具、替代人類執行多步驟操作的“超級入口”。隨着語音、智能代理與跨設備生態的加速融合,未來用戶只需說出目標,AI 便會接管後續的繁瑣操作。
VIP會員