OpenAI 宣佈將 GPT-Live-1 引入 API,開發者可據此打造支持實時語音交互的應用和業務流程。該模型支持全雙工對話,能同時聽取和輸出語音,並在對話過程中處理打斷、停頓及背景噪聲。

GPT-Live-1 還支持電話場景,可用於預訂餐廳、客戶服務等全雙工語音智能體。OpenAI 表示,開發者可以將其與 Codex 等工具連接,也可以通過 OpenAI Presence 開發能夠查詢企業系統、執行獲批操作並在必要時轉交人工的語音工作。

image.png

語音理解與輸出合爲一體,延遲更低

據介紹,GPT-Live-1 將語音理解與語音輸出整合在同一模型中,減少傳統“語音轉文字—大語言模型—文字轉語音”的多次銜接,從而降低延遲;模型也支持將複雜推理和工具調用交由後端文本模型處理。開發者可通過系統提示詞調整語氣、語速和對話風格,也可配置後端模型、工具及智能體框架。OpenAI 表示,GPT-Live-1 支持原生語音識別轉寫和回覆文本,並具備字母數字理解、關鍵詞偏置及輪次檢測能力。

早期評估顯示,語言學習平臺 Speak 使用 GPT-Live-1 後,學習者思考停頓期間的誤打斷次數較此前基於輪次的系統減少近 80%;醫療服務平臺聯合創始人兼首席技術官 Tony Stoyanov 表示,其團隊將代碼量減少了 80%,刪除約 2.3 萬行代碼。OpenAI 公佈的評測結果顯示,GPT-Live-1 在 Full Duplex Bench 測試中比 GPT-Realtime-2.1 高出 30 個百分點,在搭配 GPT-6 Astra 中等推理強度時,Tau3 端到端語音智能體任務測試排名第一

前端語音層每分鐘 0.05 美元,新增 12 種聲音

價格方面,GPT-Live-1 前端語音層爲每分鐘 0.05 美元,按每小時 60 分鐘計算約 3 美元(約合 20.2 元人民幣),後端模型和智能體工具的費用另行計算。OpenAI 同時擴大了實時語音選項,新增 Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta 和 Cinder 等聲音,並計劃在未來數月繼續增加語音和語言支持。