谷歌近日發佈Gemini Live全新語音功能更新,試圖讓用戶通過自然語音指令調用聊天、Spark、每日簡報等能力,完成信息處理、任務執行等操作。谷歌表示,升級後的Gemini應用能夠自動理解用戶需求,無需用戶判斷具體任務應使用哪項功能。

不過,這一設計也暴露出當前AI應用面臨的交互挑戰。儘管谷歌希望通過語音入口簡化操作,但Gemini仍將聊天、Spark和每日簡報作爲獨立功能呈現,分別擁有不同圖標和入口,增加了用戶理解和選擇成本。
其中,每日簡報依託Gmail、日曆等谷歌生態數據,爲用戶提供主動式個性化更新,但其信息篩選能力仍存在不足,部分提醒可能並非用戶當前所需。相比之下,Spark作爲具備任務執行能力的AI代理,更接近未來AI助手的發展方向,但谷歌將其獨立品牌化,也讓用戶需要額外理解不同功能之間的區別。
這一問題並非Gemini獨有。當前AI行業普遍存在將內部模型架構、功能模式直接暴露給用戶的問題。例如,部分AI產品要求用戶區分聊天、協作、代理等不同模式,而消費者更希望通過統一入口提出需求,由AI自動判斷並調用合適能力。
業內認爲,未來AI助手的發展方向可能是降低交互複雜度,將複雜的模型、代理和工具調用隱藏在後臺。蘋果圍繞Siri的策略,以及部分基於文本交互的AI代理產品,均強調通過熟悉的聊天方式完成任務。隨着AI能力不斷增強,如何讓用戶無需學習新的操作邏輯,或將成爲下一階段AI產品競爭的重要方向。
VIP會員