OpenAI 於 2026 年 9 月 10 日正式把 GPT-Live-1 開放至 API,讓開發者以單一模型建立語音應用與業務流程。這款模型最早隨 ChatGPT 對外亮相,其特點是能同時聆聽與說話,並可把較深層的推理與操作委派給搭配的模型與工具。官方為 API 版本新增多項控制能力,目標是讓開發者依照自身使用者、工作流程與目標調整語音體驗。
OpenAI 在 2026 年 9 月 10 日把 GPT-Live-1 語音模型開放至 API,每分鐘收費 0.05 美元,單一模型同時處理聽與說,並可把推理委派給後端文字模型。
這項發布的重點並不在於增加一種聲音,而在於把語音代理的架構層數減少。傳統做法需要串接語音辨識、推理模型與語音合成三個階段,每一次交接都會增加延遲,也更容易遺失時序與對話節奏。GPT-Live-1 把聆聽與說話合併在同一個模型內處理,讓開發者省去協調這些階段的工程負擔。
GPT-Live-1 是什麼?
GPT-Live-1 是 OpenAI 的即時語音模型,可在單一模型內同時聆聽與說話,並把深度推理與工具呼叫委派給後端文字模型,適合建構語音代理。
GPT-Live-1 屬於即時語音模型,先前已在 ChatGPT 中提供使用,此次則以 API 形式向開發者開放。它的運作方式是同時接收與輸出音訊,並在需要更深層推理時,把工作交給後端文字模型執行,對話本身則維持不中斷。開發者可自行決定背後搭配的模型、工具與代理框架,例如以輕量模型處理預約或訂單查詢等大量任務,再以推理能力較強的模型處理複雜客訴。
GPT-Live-1 有哪些核心能力?
核心能力包括中斷處理、推理與工具呼叫委派、語氣與語速控制、靜音與背景噪音管理、長時段對話穩定性,以及電話語音代理部署支援。
第一項能力是中斷處理。由於模型同時推理傳入與傳出的音訊,使用者中途插話、停頓或改變主意時,系統不必依賴容易出錯的階段交接,即可即時回應。官方引述早期客戶 Speak 的評估,指其語言導師在回應前獲得更多思考時間,中斷次數較以往的輪替式系統減少接近八成。
第二項能力是推理與工具呼叫的委派。GPT-Live-1 可把較複雜的推理與工具操作交給 GPT-6 Astra 或第三方模型處理,語音層本身專注於對話節奏。第三項能力是語氣、語速與風格控制,開發者透過系統提示即可調整代理的表達方式。此外,模型對背景噪音與靜音的處理更為成熟,不會為每個步驟旁白說明,長時段對話的上下文保留與品質亦有所改善。
全雙工語音架構能解決什麼問題?
全雙工讓模型同時聽與說,省去語音辨識、推理與語音合成三段串接,降低延遲與交接錯誤,官方稱其表現較 GPT-Realtime-2.1 高 30 個百分點。
在傳統架構下,開發者必須自行協調各階段的行為,包括使用者插話、停頓或改變方向時的處理方式。GPT-Live-1 以單一模型承擔語音層,把較深層的工作留在背景執行,使對話得以持續進行。官方評測顯示,其全雙工基準表現較 GPT-Realtime-2.1 提升 30 個百分點,在輪替延遲與互動行為方面改善明顯;搭配 GPT-6 Astra 於中等推理強度時,亦在衡量端到端語音代理智能的 Tau3 評測中排名第一。
開發者如何把語音代理投入電話場景?
模型支援電話部署,可建立全雙工語音代理處理訂位與客服來電;同時原生提供語音辨識逐字稿與回應文字,並支援關鍵詞加權。
GPT-Live-1 支援電話(telephony)部署,讓開發者把全雙工語音代理用於電話訂位或客戶支援等場景。模型原生提供語音辨識逐字稿與回應文字,並具備良好的英數字理解能力與關鍵詞加權功能。雖然 GPT-Live-1 並非輪替式模型,但仍原生支援輪次偵測,開發者若既有系統以明確的輪次界線運作,仍可沿用原有設計。官方同時擴充聲音選項,由過去少數幾種即時語音,擴展至涵蓋更多口音、方言與語言的選擇,並表示未來數月會持續增加。
定價與可用性如何?
GPT-Live-1 已於 API 提供,前置語音層每分鐘 0.05 美元,後端模型與工具費用另計;自訂聲音需聯絡銷售團隊查詢資格。
GPT-Live-1 即日起於 API 提供,前置語音層每分鐘收費 0.05 美元,開發者再依產品需求搭配後端模型與代理框架,費用則按實際用量計算。若需要自訂聲音,OpenAI 表示需經銷售團隊評估資格與申請流程。企業亦可透過 OpenAI Presence 建構語音工作流程,該方案同樣以這個模型驅動即時語音互動,並支援回答問題、操作公司系統、執行已核准動作,以及在需要時轉交真人處理。
出處連結有哪些?
本文資訊整理自 OpenAI 於 2026 年 9 月 10 日發布的官方公告,內容涵蓋 GPT-Live-1 的模型能力、基準表現與定價方式。
常見問題有哪些?
本文整理四條常見問題,涵蓋 GPT-Live-1 與傳統語音架構的差異、後端模型搭配、電話客服應用,以及實際收費方式。
GPT-Live-1 與傳統語音代理架構有何差別?
傳統架構把語音辨識、推理與語音合成分為三段,每次交接都會增加延遲;GPT-Live-1 以單一模型同時處理聽與說,可減少交接錯誤並改善對話節奏。
使用 GPT-Live-1 需要自行搭配推理模型嗎?
需要。GPT-Live-1 負責語音層,較深層的推理與工具呼叫會委派給後端文字模型,開發者可依任務複雜度與成本選擇合適模型。
GPT-Live-1 可以應用在電話客服嗎?
可以。模型支援電話部署,能建立全雙工語音代理處理訂位與客服來電,並原生提供語音辨識逐字稿與回應文字。
GPT-Live-1 的收費方式是什麼?
前置語音層每分鐘收費 0.05 美元,後端模型與工具則按實際用量計算;若需自訂聲音,須向銷售團隊查詢資格與申請流程。
總結:GPT-Live-1 適合什麼團隊?
適合正在建構語音代理、希望降低串接延遲與工程負擔的團隊;若僅需單向語音轉文字,或對成本極度敏感,傳統方案仍具優勢。
GPT-Live-1 把語音代理中最容易出錯的交接層收進單一模型,讓開發者把精力放在工具、知識與工作流程之上。對於需要自然對話節奏、又要維持推理深度的團隊,這條路徑提供較低的架構複雜度;至於僅需單向語音轉錄,或對每分鐘成本高度敏感的應用,分段式方案仍值得一併評估。