OpenAI представила GPT-Live — голосовую модель с полнодуплексным взаимодействием
GPT-Live — новая голосовая модель OpenAI для голосового режима ChatGPT. Она может одновременно слушать и говорить, обрабатывать паузы и перебивания, а сложные задачи передавать фоновой модели, которой на старте стала GPT-5.5.
Главное изменение GPT-Live — переход от строгой очередности реплик к непрерывному взаимодействию. Во время генерации речи модель продолжает обрабатывать входящий звук и несколько раз в секунду решает, говорить ли дальше, продолжать ли слушать, сделать ли паузу, ответить на перебивание или вызвать инструмент. По данным OpenAI, это делает диалог естественнее и позволяет выполнять перевод в реальном времени.
Архитектура также разделяет живое голосовое общение и глубокое рассуждение. Голосовой слой поддерживает темп разговора, а поиск в интернете, сложный анализ и другие длительные операции могут передаваться более мощной модели с последующим возвратом результата в диалог. Представленные источники подтверждают эту общую схему, но не подтверждают независимо заявления о переходе на Go, протоколе WARP, конкретном сокращении сетевых обменов или задержке менее секунды.
Источники
語音即AI入口!OpenAI推GPT-Live 打造真人般實時對話體驗hk.finance.yahoo.com · supporting此次推出的 GPT-Live 並非單一模型,而是區分為兩個版本。其中 GPT-Live-1 預設提供 Go、Plus 及 Pro 付費訂閱用戶使用;GPT-Live-1 mini 則開放免費用戶作為預設語音模型。新版已開始陸續推送至全球 Web 版、iOS 及 Android 平台,但先前曾回退新版語音能力的桌面版 ChatGPT,目前仍未重新支援新版語音體驗。 OpenAI 表示,相較於現行 Advanced Voice Mode,GPT-Live 最大的提升並非只有反應速度,而是整體語音交流品質。公司為此建立全新的人工評測體系,針對對話舒適度 (pleasantness) 及整體交流流暢性 (flow of conversation) 進行評估,並安排 5 至 10 分鐘一對一盲測。 測試結果顯示,無論 GPT-Live-1 或 GPT-Live-1 mini,在整體交流體驗 (Overall Preference)、輪流說話自然程度(Turn-taking)、遭使用者打斷後的恢復能力(Interruptions)、對話流暢性(Conversational Flow),以及整體是否更接近真人交流(Naturalness) 等多項指標,均明顯優於 Advanced Voice Mode,這也是 OpenAI 決定全面取代舊版語音模型的重要原因。 技術方面,GPT-Live 最大的升級在於採用原生全雙工語音架構,突破過去 AI 語音助理普遍採用「你說一句、我答一句」的 Turn-based 模式。新模型可一邊聆聽、一邊理解使用者內容,同時即時準備回應,不必等待完整句子結束才開始辨識,因此能判斷使用者只是短暫停頓思考,或是真正結束發言;若使用者中途插話,模型也能立即停止回答重新傾聽,再自然接續對話,使互動更貼近真人交流。 [...] 除對話體驗提升外,GPT-Live 還新增多項功能,包括即時雙向翻譯 (Live Translation)、更精準的語音聽寫 (Dictation)、更自然的停頓、語調及情緒回饋,並可依照使用者要求即時調整說話速度。例如,當使用者要求「可以說慢一點嗎」,模型會直接重新調整語音節奏,而非僅降低音訊播放速度。 OpenAI 強調,GPT-Live 並非只是新的語音模型,而是整個 ChatGPT 能力體系的統一入口。當使用者提出需要複雜
OpenAI的新语音模型,先把用户烦到了-36氪m.36kr.com · supporting用户停顿一秒,可能是说完了,也可能只是还在想;用户拖长音,可能是在组织语言,也可能是酝酿情绪;背景里传来别人的声音,可能被误判成新的输入。 回合制语音模型最难处理的,就是这个边界。 GPT-Live通过两项架构上的改进,去解决这个问题。 第一项改进,是把语音对话从“轮流发言”推进到full-duplex。 它可以持续听、持续判断、持续生成语音,而不只是在用户结束发言后才进入回答状态。 或者说,模型在参与一场仍在发生的对话,而不只是回答一个已经结束的问题。 根据官方介绍,GPT-Live每秒可以做出多次交互决策:是继续说话、继续倾听、暂停、打断对方的话语,还是调用某个工具。这让它能够进行更自然的互动交流、更好地把握时间顺序,甚至可以实时翻译。 可以看到,在用户说话的过程中,GPT-Live会给出一些情绪上的回应。就像你和你朋友煲电话粥,总会夹杂着一些“嗯”“哦”的声音。 事实上,GPT-Live并不是第一个尝试全双工架构的语音模型。此前Kyutai的Moshi、英伟达的PersonaPlex,以及一批学术模型,已经在探索让AI同时听和说,处理停顿、插话和短反馈;谷歌的Gemini Live虽然没有强调全双工,但也已经在做实时语音对话和原生音频模型,方向上非常接近。 GPT-Live的不同之处,是把“边听边说”的能力带进了ChatGPT这个主流入口,并且能和OpenAI的其它模型一起配合。 这就要说到第二项改进:语音交互层和后台智能之间的分工。 GPT-Live并不只是一个“更会说话的模型”,它更像ChatGPT的实时语音交互层:负责听、说、等待、打断、判断何时回应,也负责维持对话节奏。 遇到需要搜索、推理或复杂任务的问题时,它可以把任务交给背后的更强模型处理。 [...] 而且你们可能已经注意到了,它只做了纵向比较(和自己以前的模型作对比),横向是一点也没提。 我们无从得知,GPT-Live放到整个语音AI行业里,到底处在什么位置。 网友对此的评价比较两极分化。 一部分人认为,这次更新具有非常大的潜力,如果能用在编程上,或许会改变很多人的习惯。 但也有很多网友认为,GPT-Live这种频频回应的方式有些令人生厌。 还有人指出了它现在的问题,比如在实时模式下无法查询到ChatGPT的记忆,又比如明明是语音功能,却在摄像头模式和屏幕共享模
推出 GPT-Liveopenai.com · supporting2026年7月8日 # 推出 GPT‑Live 新一代语音模型,实现更自然的人与 AI 交互,现已应用于 ChatGPT 语音 2026 年 7 月 31 日更新:现在,通过 ChatGPT 语音及 OpenAI API 中的 GPT‑Live 生成的受支持音频,均已加入 SynthID 水印。我们的公开验证工具现已能够检测受支持音频文件中的 OpenAI 内容溯源信号。此外,我们还推出了用于验证的 API 访问权限,以便开发者和组织能够将内容溯源检查整合到各自的工作流中。这些更新建立在下文所述的安全策略之上,并进一步推进了我们在让 OpenAI 生成内容更易于被识别方面所做出的广泛努力。 我们正在推出 GPT‑Live,这是新一代语音模型,让与 AI 交谈更像一场真实对话。 GPT‑Live 基于全双工架构构建,这意味着它可以同时倾听和说话。在对话中,GPT‑Live 可以用“嗯嗯”或“是啊”这样的短语表示它正在专心听,进行快速来回交流,也可以在你需要时间思考时保持安静。由此带来的语音体验令人耳目一新,也更容易交谈。 GPT‑Live 也是我们迄今最智能的语音模型。对于需要网页搜索、更深入推理或更复杂工作的提问,它会在幕后委派给我们最新的前沿模型,并在结果准备好后带回到对话中。在处理这些任务时,GPT‑Live 仍可以继续与你交谈,保持对话流畅。发布时,GPT‑Live 将在后台使用 GPT‑5.5。随着我们发布新的前沿模型,我们会持续更新 GPT‑Live 所使用的模型。 这些进展带来了更智能、更自然易用的全新 ChatGPT 语音体验。我们相信,随着时间推移,这项研究还将让人们能够用语音完成越来越复杂、持续时间更长、也更具智能体特性的工作。 [...] ### 我们的新方法 GPT‑Live 通过两项架构变化解决了这些限制。 ### 连续交互 首先,我们基于全双工架构构建了 GPT‑Live,以支持连续交互。GPT‑Live 不再处理一连串彼此独立的消息,而是在生成输出的同时连续处理输入。因此,模型可以在每秒内多次做出交互决策:是说话、继续倾听、暂停、打断,还是调用工具。 这让模型能够进行更自然的来回交流,更好地把握时间,甚至执行实时翻译。 ### 连续交互 响应快速、自然且富有表现力,倾听也更为积极 ### 委派处理更深入的工作
GPT-Live 登場openai.com · supporting2026年7月8日 # GPT‑Live 登場 新一代語音模型,帶來自然的人類與 AI 互動,現為 ChatGPT 語音提供核心技術支援。 2026 年 7 月 31 日更新: 由 GPT‑Live 透過 ChatGPT 語音和 OpenAI API 生成的受支援音訊,現已加入 SynthID 浮水印。我們的公開驗證工具現可偵測受支援音訊檔案中的 OpenAI 來源識別訊號。我們亦已開放透過 API 使用驗證功能,讓開發人員和機構可將來源驗證整合至自己的工作流程。這些更新沿用下文所述的安全方針,亦延續我們讓 OpenAI 生成內容更容易識別的整體工作。 我們全新推出 GPT‑Live,這是新一代語音模型,讓與 AI 對話的感覺更接近真正交談。 GPT‑Live 建基於全雙工架構,亦即它可以同時聆聽和說話。在對話期間,GPT‑Live 可以用「嗯嗯」或「對」等語句表示它正在留心聆聽、快速來回交流,或在你需要片刻思考時保持安靜。這帶來令人耳目一新、容易對話的語音體驗。 GPT‑Live 也是我們迄今最智能的語音模型。對於需要網絡搜尋、更深入推理或更複雜工作的問題,它會在幕後委派給我們最新的前沿模型,並在結果準備好後帶回對話中。在工作進行期間,GPT‑Live 可以繼續與你交談,維持對話流暢。推出時,GPT‑Live 會在背景使用 GPT‑5.5。隨着我們推出新的前沿模型,我們會持續更新 GPT‑Live 所使用的模型。 這些進展帶來全新的 ChatGPT 語音體驗,使用起來更智能、更自然。長遠而言,我們相信這項研究也會開啟更多可能性,讓我們以語音處理越來越複雜、耗時更長且更具智能代理能力的工作。 [...] ### 我們的新方法 GPT‑Live 透過兩項架構改變來處理這些限制。 ### 連續互動 首先,我們以全雙工架構建構 GPT‑Live,支援連續互動。GPT‑Live 並非處理一連串分開的訊息,而是在生成輸出的同時持續處理輸入。因此,模型每秒都能多次作出互動決策:是否說話、繼續聆聽、暫停、插話或調用工具。 這讓模型能夠進行更自然的來回互動、更好地掌握時間感,甚至執行即時翻譯。 ### 連續互動 回應快速、自然而且富表現力,同時聆聽更主動 ### 委派更深入的工作 其次,我們將負責連續互動的 GPT‑Live 與更深入的工作分離。當問題
介紹 GPT-Liveopenai.com · supporting2026年7月8日 # 介紹 GPT‑Live 新一代語音模型,讓人類與 AI 的互動更自然,現已應用於 ChatGPT 語音。 2026 年 7 月 31 日更新:透過 ChatGPT 語音和 OpenAI API 使用 GPT‑Live 生成的受支援音訊,現已加入 SynthID 浮水印。我們的公開驗證工具現在可偵測受支援音訊檔案中的 OpenAI 來源訊號。我們也已開放透過 API 進行驗證,讓開發人員和組織能將來源驗證納入自己的工作流程。這些更新延續下文所述的安全做法,也推進我們更廣泛的相關工作,讓 OpenAI 生成的內容更容易辨識。 我們推出 GPT‑Live,這是新一代語音模型,讓與 AI 對話更接近真人交流。 GPT‑Live 採用全雙工架構,因此能同時聆聽與說話。在對話中,GPT‑Live 可以用「嗯哼」或「對」等語句表示它正在聆聽,也能快速自然地來回對話,或在你需要思考時安靜等待。這讓語音對話體驗更加自然,聊起來格外輕鬆。 GPT‑Live 也是我們迄今最聰明的語音模型。對於需要網路搜尋、更深入推理或更複雜工作的問題,它會在幕後委派給我們最新的前沿模型,等結果準備好後再帶回對話中。在處理工作的同時,GPT‑Live 仍能繼續與你交談,維持對話流暢。推出初期,GPT‑Live 會在背景使用 GPT‑5.5。隨著我們推出新的前沿模型,我們也會持續更新 GPT‑Live 所使用的模型。 這些進展支撐了全新的 ChatGPT 語音體驗,讓使用過程更智慧、更自然。長遠來看,我們相信這項研究也將開啟以語音處理越來越複雜、耗時更長且更仰賴智慧體能力工作的可能性。 [...] ### 我們的新方法 GPT‑Live 透過兩項架構改變來解決這些限制。 ### 連續互動 首先,我們以全雙工架構打造 GPT‑Live,使其能進行連續互動。GPT‑Live 不再逐則處理彼此獨立的訊息,而是在生成輸出的同時持續處理輸入。因此,模型每秒可多次決定是否要說話、繼續聆聽、暫停、插話,或呼叫工具。 這讓模型能進行更自然的來回對話,更準確掌握對話節奏,甚至提供即時翻譯。 ### 連續互動 回應快速、自然而且富表現力,同時聆聽更主動 ### 將更深入的工作委派給其他模型 其次,我們將負責持續互動的 GPT‑Live 與負責較深入工作的模型分離。當問題需要
宝玉 on X: "OpenAI 今天发布 GPT-Live,用全双工架构(full-duplex)取代 ChatGPT 原有的语音模式。同声传译的演示效果很惊艳。 两个型号 GPT-Live-1 和 GPT-Live-1 mini,分别面向付费和免费用户,今天起在 iOS、Android 和网页端全球推出。 这是 ChatGPT https://t.co/tpnj2Ouwwh" / Xx.com · supportingOpenAI 今天发布 GPT-Live,用全双工架构(full-duplex)取代 ChatGPT 原有的语音模式。同声传译的演示效果很惊艳。 两个型号 GPT-Live-1 和 GPT-Live-1 mini,分别面向付费和免费用户,今天起在 iOS、Android 和网页端全球推出。 这是 ChatGPT 语音的第三代技术。之前的语音模式本质上是"对讲机"模式,你说完它才说,中间稍微停顿一下就可能被打断。GPT-Live 改成了全双工,可以一边听你说一边自己说,每秒做多次交互决策,判断该说话、该闭嘴、该打断还是该调用工具。对话中它会像真人一样插入"mhmm""got it"之类的回应,表示在听。 架构上有一个比较有意思的变化:GPT-Live 把语音交互层和推理层拆开了。日常对话它自己处理,遇到需要联网搜索、深度推理的问题,就后台交给 GPT-5.5 去干活,自己继续跟你聊着。等结果出来了再无缝带回对话。OpenAI 说以后出了更新的模型会持续替换后端,前端语音模型不用重新训练。这个设计对做语音智能体的开发者可能比较有吸引力,也给了 OpenAI 一个把语音产品和模型迭代解耦的机制。 用户端还加了三档推理强度可选:Instant(快速回答)、Medium 和 High(需要想一会儿的复杂问题),九个语音角色也重新录制过。语音对话中还能显示天气、股票、体育比分等可视化卡片。 不过上线第一天用户反馈就出现了一个有点讽刺的问题:那些设计来让对话更自然的回应词,实际用起来让不少人觉得烦。社交媒体上已经有用户吐槽 GPT-Live 的"mhmm"太频繁,声音直接闯入注意力的感受和文字不同,AI 的热情过了头反而成了干扰。TechCrunch 在报道中也提到,演示中展示印地语实时翻译时,模型带着明显的美式口音,措辞偏书面,效果并不理想。OpenAI [...] 在报道中也提到,演示中展示印地语实时翻译时,模型带着明显的美式口音,措辞偏书面,效果并不理想。OpenAI 说"针对最常用语言做了优化",但没有公布具体支持哪些语言。 另外,GPT-Live 上线时不支持视频通话和屏幕共享,需要这些功能的用户得切回旧版。API 也还没开放,开发者只能先登记排队。 每周有超过 1.5 亿人使用 ChatGPT 的语音和听写功能。OpenAI 显然把语音视为下一个主力交互界面,Chat