Notice
数据公告

QQ群和tg群已经启用,欢迎加入。公开信息来源均审核后发布;请结合来源、库存和更新时间判断。

Community & contactTelegram 群点击加入Telegram 频道点击订阅联系我们tgAIPricedb交流群979789483
Back to news
Products

OpenAI Introduces GPT-Live, a Full-Duplex Voice Model for More Natural Conversations

GPT-Live is OpenAI’s new voice model for ChatGPT voice. It can listen and speak simultaneously, handle interruptions and pauses, and delegate search or complex reasoning tasks to a backend model, initially GPT-5.5.

62% VERIFIED

GPT-Live’s main architectural change is continuous interaction rather than strict turn-taking. While generating audio, it keeps processing incoming speech and can repeatedly decide whether to speak, keep listening, pause, interrupt, or call a tool. OpenAI says this enables more natural exchanges and supports real-time translation.

The system also separates live conversational behavior from deeper reasoning. The voice layer maintains the flow of the conversation, while more demanding tasks such as web search or complex analysis can be delegated to a stronger model and brought back when the result is ready. The supplied evidence supports this overall design, but does not independently verify claims about a Go rewrite, the WARP protocol, specific round-trip reductions, or sub-second latency.

Source evidence

語音即AI入口!OpenAI推GPT-Live 打造真人般實時對話體驗hk.finance.yahoo.com · supporting

此次推出的 GPT-Live 並非單一模型,而是區分為兩個版本。其中 GPT-Live-1 預設提供 Go、Plus 及 Pro 付費訂閱用戶使用;GPT-Live-1 mini 則開放免費用戶作為預設語音模型。新版已開始陸續推送至全球 Web 版、iOS 及 Android 平台,但先前曾回退新版語音能力的桌面版 ChatGPT,目前仍未重新支援新版語音體驗。 OpenAI 表示,相較於現行 Advanced Voice Mode,GPT-Live 最大的提升並非只有反應速度,而是整體語音交流品質。公司為此建立全新的人工評測體系,針對對話舒適度 (pleasantness) 及整體交流流暢性 (flow of conversation) 進行評估,並安排 5 至 10 分鐘一對一盲測。 測試結果顯示,無論 GPT-Live-1 或 GPT-Live-1 mini,在整體交流體驗 (Overall Preference)、輪流說話自然程度(Turn-taking)、遭使用者打斷後的恢復能力(Interruptions)、對話流暢性(Conversational Flow),以及整體是否更接近真人交流(Naturalness) 等多項指標,均明顯優於 Advanced Voice Mode,這也是 OpenAI 決定全面取代舊版語音模型的重要原因。 技術方面,GPT-Live 最大的升級在於採用原生全雙工語音架構,突破過去 AI 語音助理普遍採用「你說一句、我答一句」的 Turn-based 模式。新模型可一邊聆聽、一邊理解使用者內容,同時即時準備回應,不必等待完整句子結束才開始辨識,因此能判斷使用者只是短暫停頓思考,或是真正結束發言;若使用者中途插話,模型也能立即停止回答重新傾聽,再自然接續對話,使互動更貼近真人交流。 [...] 除對話體驗提升外,GPT-Live 還新增多項功能,包括即時雙向翻譯 (Live Translation)、更精準的語音聽寫 (Dictation)、更自然的停頓、語調及情緒回饋,並可依照使用者要求即時調整說話速度。例如,當使用者要求「可以說慢一點嗎」,模型會直接重新調整語音節奏,而非僅降低音訊播放速度。 OpenAI 強調,GPT-Live 並非只是新的語音模型,而是整個 ChatGPT 能力體系的統一入口。當使用者提出需要複雜

OpenAI的新语音模型,先把用户烦到了-36氪m.36kr.com · supporting

用户停顿一秒,可能是说完了,也可能只是还在想;用户拖长音,可能是在组织语言,也可能是酝酿情绪;背景里传来别人的声音,可能被误判成新的输入。 回合制语音模型最难处理的,就是这个边界。 GPT-Live通过两项架构上的改进,去解决这个问题。 第一项改进,是把语音对话从“轮流发言”推进到full-duplex。 它可以持续听、持续判断、持续生成语音,而不只是在用户结束发言后才进入回答状态。 或者说,模型在参与一场仍在发生的对话,而不只是回答一个已经结束的问题。 根据官方介绍,GPT-Live每秒可以做出多次交互决策:是继续说话、继续倾听、暂停、打断对方的话语,还是调用某个工具。这让它能够进行更自然的互动交流、更好地把握时间顺序,甚至可以实时翻译。 可以看到,在用户说话的过程中,GPT-Live会给出一些情绪上的回应。就像你和你朋友煲电话粥,总会夹杂着一些“嗯”“哦”的声音。 事实上,GPT-Live并不是第一个尝试全双工架构的语音模型。此前Kyutai的Moshi、英伟达的PersonaPlex,以及一批学术模型,已经在探索让AI同时听和说,处理停顿、插话和短反馈;谷歌的Gemini Live虽然没有强调全双工,但也已经在做实时语音对话和原生音频模型,方向上非常接近。 GPT-Live的不同之处,是把“边听边说”的能力带进了ChatGPT这个主流入口,并且能和OpenAI的其它模型一起配合。 这就要说到第二项改进:语音交互层和后台智能之间的分工。 GPT-Live并不只是一个“更会说话的模型”,它更像ChatGPT的实时语音交互层:负责听、说、等待、打断、判断何时回应,也负责维持对话节奏。 遇到需要搜索、推理或复杂任务的问题时,它可以把任务交给背后的更强模型处理。 [...] 而且你们可能已经注意到了,它只做了纵向比较(和自己以前的模型作对比),横向是一点也没提。 我们无从得知,GPT-Live放到整个语音AI行业里,到底处在什么位置。 网友对此的评价比较两极分化。 一部分人认为,这次更新具有非常大的潜力,如果能用在编程上,或许会改变很多人的习惯。 但也有很多网友认为,GPT-Live这种频频回应的方式有些令人生厌。 还有人指出了它现在的问题,比如在实时模式下无法查询到ChatGPT的记忆,又比如明明是语音功能,却在摄像头模式和屏幕共享模

推出 GPT-Liveopenai.com · supporting

2026年7月8日 # 推出 GPT‑Live 新一代语音模型,实现更自然的人与 AI 交互,现已应用于 ChatGPT 语音 2026 年 7 月 31 日更新:现在,通过 ChatGPT 语音及 OpenAI API 中的 GPT‑Live 生成的受支持音频,均已加入 SynthID 水印。我们的公开验证工具现已能够检测受支持音频文件中的 OpenAI 内容溯源信号。此外,我们还推出了用于验证的 API 访问权限,以便开发者和组织能够将内容溯源检查整合到各自的工作流中。这些更新建立在下文所述的安全策略之上,并进一步推进了我们在让 OpenAI 生成内容更易于被识别方面所做出的广泛努力。 我们正在推出 GPT‑Live,这是新一代语音模型,让与 AI 交谈更像一场真实对话。 GPT‑Live 基于全双工架构构建,这意味着它可以同时倾听和说话。在对话中,GPT‑Live 可以用“嗯嗯”或“是啊”这样的短语表示它正在专心听,进行快速来回交流,也可以在你需要时间思考时保持安静。由此带来的语音体验令人耳目一新,也更容易交谈。 GPT‑Live 也是我们迄今最智能的语音模型。对于需要网页搜索、更深入推理或更复杂工作的提问,它会在幕后委派给我们最新的前沿模型,并在结果准备好后带回到对话中。在处理这些任务时,GPT‑Live 仍可以继续与你交谈,保持对话流畅。发布时,GPT‑Live 将在后台使用 GPT‑5.5。随着我们发布新的前沿模型,我们会持续更新 GPT‑Live 所使用的模型。 这些进展带来了更智能、更自然易用的全新 ChatGPT 语音体验。我们相信,随着时间推移,这项研究还将让人们能够用语音完成越来越复杂、持续时间更长、也更具智能体特性的工作。 [...] ### 我们的新方法 GPT‑Live 通过两项架构变化解决了这些限制。 ### 连续交互 首先,我们基于全双工架构构建了 GPT‑Live,以支持连续交互。GPT‑Live 不再处理一连串彼此独立的消息,而是在生成输出的同时连续处理输入。因此,模型可以在每秒内多次做出交互决策:是说话、继续倾听、暂停、打断,还是调用工具。 这让模型能够进行更自然的来回交流,更好地把握时间,甚至执行实时翻译。 ### 连续交互 响应快速、自然且富有表现力,倾听也更为积极 ### 委派处理更深入的工作

GPT-Live 登場openai.com · supporting

2026年7月8日 # GPT‑Live 登場 新一代語音模型,帶來自然的人類與 AI 互動,現為 ChatGPT 語音提供核心技術支援。 2026 年 7 月 31 日更新: 由 GPT‑Live 透過 ChatGPT 語音和 OpenAI API 生成的受支援音訊,現已加入 SynthID 浮水印。我們的公開驗證工具現可偵測受支援音訊檔案中的 OpenAI 來源識別訊號。我們亦已開放透過 API 使用驗證功能,讓開發人員和機構可將來源驗證整合至自己的工作流程。這些更新沿用下文所述的安全方針,亦延續我們讓 OpenAI 生成內容更容易識別的整體工作。 我們全新推出 GPT‑Live,這是新一代語音模型,讓與 AI 對話的感覺更接近真正交談。 GPT‑Live 建基於全雙工架構,亦即它可以同時聆聽和說話。在對話期間,GPT‑Live 可以用「嗯嗯」或「對」等語句表示它正在留心聆聽、快速來回交流,或在你需要片刻思考時保持安靜。這帶來令人耳目一新、容易對話的語音體驗。 GPT‑Live 也是我們迄今最智能的語音模型。對於需要網絡搜尋、更深入推理或更複雜工作的問題,它會在幕後委派給我們最新的前沿模型,並在結果準備好後帶回對話中。在工作進行期間,GPT‑Live 可以繼續與你交談,維持對話流暢。推出時,GPT‑Live 會在背景使用 GPT‑5.5。隨着我們推出新的前沿模型,我們會持續更新 GPT‑Live 所使用的模型。 這些進展帶來全新的 ChatGPT 語音體驗,使用起來更智能、更自然。長遠而言,我們相信這項研究也會開啟更多可能性,讓我們以語音處理越來越複雜、耗時更長且更具智能代理能力的工作。 [...] ### 我們的新方法 GPT‑Live 透過兩項架構改變來處理這些限制。 ### 連續互動 首先,我們以全雙工架構建構 GPT‑Live,支援連續互動。GPT‑Live 並非處理一連串分開的訊息,而是在生成輸出的同時持續處理輸入。因此,模型每秒都能多次作出互動決策:是否說話、繼續聆聽、暫停、插話或調用工具。 這讓模型能夠進行更自然的來回互動、更好地掌握時間感,甚至執行即時翻譯。 ### 連續互動 回應快速、自然而且富表現力,同時聆聽更主動 ### 委派更深入的工作 其次,我們將負責連續互動的 GPT‑Live 與更深入的工作分離。當問題

介紹 GPT-Liveopenai.com · supporting

2026年7月8日 # 介紹 GPT‑Live 新一代語音模型,讓人類與 AI 的互動更自然,現已應用於 ChatGPT 語音。 2026 年 7 月 31 日更新:透過 ChatGPT 語音和 OpenAI API 使用 GPT‑Live 生成的受支援音訊,現已加入 SynthID 浮水印。我們的公開驗證工具現在可偵測受支援音訊檔案中的 OpenAI 來源訊號。我們也已開放透過 API 進行驗證,讓開發人員和組織能將來源驗證納入自己的工作流程。這些更新延續下文所述的安全做法,也推進我們更廣泛的相關工作,讓 OpenAI 生成的內容更容易辨識。 我們推出 GPT‑Live,這是新一代語音模型,讓與 AI 對話更接近真人交流。 GPT‑Live 採用全雙工架構,因此能同時聆聽與說話。在對話中,GPT‑Live 可以用「嗯哼」或「對」等語句表示它正在聆聽,也能快速自然地來回對話,或在你需要思考時安靜等待。這讓語音對話體驗更加自然,聊起來格外輕鬆。 GPT‑Live 也是我們迄今最聰明的語音模型。對於需要網路搜尋、更深入推理或更複雜工作的問題,它會在幕後委派給我們最新的前沿模型,等結果準備好後再帶回對話中。在處理工作的同時,GPT‑Live 仍能繼續與你交談,維持對話流暢。推出初期,GPT‑Live 會在背景使用 GPT‑5.5。隨著我們推出新的前沿模型,我們也會持續更新 GPT‑Live 所使用的模型。 這些進展支撐了全新的 ChatGPT 語音體驗,讓使用過程更智慧、更自然。長遠來看,我們相信這項研究也將開啟以語音處理越來越複雜、耗時更長且更仰賴智慧體能力工作的可能性。 [...] ### 我們的新方法 GPT‑Live 透過兩項架構改變來解決這些限制。 ### 連續互動 首先,我們以全雙工架構打造 GPT‑Live,使其能進行連續互動。GPT‑Live 不再逐則處理彼此獨立的訊息,而是在生成輸出的同時持續處理輸入。因此,模型每秒可多次決定是否要說話、繼續聆聽、暫停、插話,或呼叫工具。 這讓模型能進行更自然的來回對話,更準確掌握對話節奏,甚至提供即時翻譯。 ### 連續互動 回應快速、自然而且富表現力,同時聆聽更主動 ### 將更深入的工作委派給其他模型 其次,我們將負責持續互動的 GPT‑Live 與負責較深入工作的模型分離。當問題需要

宝玉 on X: "OpenAI 今天发布 GPT-Live,用全双工架构(full-duplex)取代 ChatGPT 原有的语音模式。同声传译的演示效果很惊艳。 两个型号 GPT-Live-1 和 GPT-Live-1 mini,分别面向付费和免费用户,今天起在 iOS、Android 和网页端全球推出。 这是 ChatGPT https://t.co/tpnj2Ouwwh" / Xx.com · supporting

OpenAI 今天发布 GPT-Live,用全双工架构(full-duplex)取代 ChatGPT 原有的语音模式。同声传译的演示效果很惊艳。 两个型号 GPT-Live-1 和 GPT-Live-1 mini,分别面向付费和免费用户,今天起在 iOS、Android 和网页端全球推出。 这是 ChatGPT 语音的第三代技术。之前的语音模式本质上是"对讲机"模式,你说完它才说,中间稍微停顿一下就可能被打断。GPT-Live 改成了全双工,可以一边听你说一边自己说,每秒做多次交互决策,判断该说话、该闭嘴、该打断还是该调用工具。对话中它会像真人一样插入"mhmm""got it"之类的回应,表示在听。 架构上有一个比较有意思的变化:GPT-Live 把语音交互层和推理层拆开了。日常对话它自己处理,遇到需要联网搜索、深度推理的问题,就后台交给 GPT-5.5 去干活,自己继续跟你聊着。等结果出来了再无缝带回对话。OpenAI 说以后出了更新的模型会持续替换后端,前端语音模型不用重新训练。这个设计对做语音智能体的开发者可能比较有吸引力,也给了 OpenAI 一个把语音产品和模型迭代解耦的机制。 用户端还加了三档推理强度可选:Instant(快速回答)、Medium 和 High(需要想一会儿的复杂问题),九个语音角色也重新录制过。语音对话中还能显示天气、股票、体育比分等可视化卡片。 不过上线第一天用户反馈就出现了一个有点讽刺的问题:那些设计来让对话更自然的回应词,实际用起来让不少人觉得烦。社交媒体上已经有用户吐槽 GPT-Live 的"mhmm"太频繁,声音直接闯入注意力的感受和文字不同,AI 的热情过了头反而成了干扰。TechCrunch 在报道中也提到,演示中展示印地语实时翻译时,模型带着明显的美式口音,措辞偏书面,效果并不理想。OpenAI [...] 在报道中也提到,演示中展示印地语实时翻译时,模型带着明显的美式口音,措辞偏书面,效果并不理想。OpenAI 说"针对最常用语言做了优化",但没有公布具体支持哪些语言。 另外,GPT-Live 上线时不支持视频通话和屏幕共享,需要这些功能的用户得切回旧版。API 也还没开放,开发者只能先登记排队。 每周有超过 1.5 亿人使用 ChatGPT 的语音和听写功能。OpenAI 显然把语音视为下一个主力交互界面,Chat