ByteDance представила SeedRealtime для полноформатного аудио- и видеодиалога
ByteDance запустила модель SeedRealtime, которая используется в функции видеозвонков Doubao. Она одновременно анализирует изображение и звук и отвечает голосом в режиме реального времени.
Команда Seed компании ByteDance объявила о выпуске SeedRealtime — модели с нативной поддержкой аудио, видео, текста и временного контекста. Через функцию звонков в приложении Doubao пользователь может вести видеодиалог, во время которого модель одновременно смотрит, слушает и говорит. Такой подход призван уменьшить задержки, характерные для систем из последовательно соединённых модулей распознавания речи, компьютерного зрения и синтеза голоса.
По данным ByteDance, SeedRealtime использует изображение, голос, жесты и историю разговора для разрешения ссылок и омофонов. В демонстрациях модель сопоставляет имена с участниками групповой беседы, помогает понимать меню, распознаёт экспонаты в музее, подсказывает при работе с кофемашиной и может самостоятельно напомнить пользователю о появлении нужного объекта.
Модель также должна определять, когда следует отвечать, а когда сохранять молчание в шумной обстановке и при перекрывающихся разговорах. ByteDance заявляет, что во внутренних сквозных тестах количество проблем с ритмом аудио- и видеодиалога снизилось примерно на 50% по сравнению с каскадными системами. Это показатель, приведённый самой компанией; независимого подтверждения в предоставленных материалах нет.
Источники
基于深度学习的多方对话研究综述scis.scichina.com · supporting关键词 自然语言处理, 深度学习, 人机对话, 多方对话 1 引言 近年来, 随着互联网上社交数据的快速增长, 得益于深度学习技术的发展, 人机对话技术取得飞 跃式进展, 同时, 因其在虚拟助手和社交机器人等领域的商业价值, 而广受学术界和工业界的关注. 目 前人机对话的研究大多聚焦于人机双方参与的场景, 然而, 现实生活中存在不少多方对话情况, 比 如社交聊天群组、在线聊天室以及各种网络论坛等. 在多方对话场景中, 存在多个参与者, 人机双 方对话系统将不足以应对这种情况, 具有参与多人对话能力的多方对话系统则应运而生. [...] Explicit Addressee means that there is an explicit signal such as “@” that indicates a listener for speaking. [...] SCIENTIA SINICA Informationis 中国科学: 信息科学 2021 年 第51 卷 第8 期: 1217–1232 c ⃝2021 《中国科学》 杂志社 www.scichina.com infocn.scichina.com 评述 基于深度学习的多方对话研究综述 张开颜, 张伟男, 刘挺 哈尔滨工业大学社会计算与信息检索研究中心, 哈尔滨150001 通信作者. E-mail: wnzhang@ir.hit.edu.cn 收稿日期: 2020–06–15; 修回日期: 2020–08–11; 接受日期: 2020–10–14; 网络出版日期: 2021–08–03 摘要 近年来, 随着深度学习技术的广泛应用, 人机对话研究取得了突破性进展. 但是, 目前的人机对 话系统大多是在人机双方参与的假设下进行设计的, 而更具挑战性的人机多方对话的研究和应用尚不 成熟. 本文将立足于自然语言处理领域, 对近几年基于深度学习的多方对话研究进展进行综述. 首先 从人机对话角度出发, 整理多方对话系统的关键问题和已有解决方案; 然后, 梳理基于多方对话的其他 自然语言处理任务; 之后, 总结已有多方对话研究的数据集, 并分析现有数据集的局限性和改进方案; 最后, 展望多方对话研究的未来发展趋势.
字节跳动发布全双工语音大模型 Seeduplexdaxue.taobao.com · supporting【本站讯】 4月9日,字节跳动 Seed 团队正式发布原生全双工语音大模型 Seeduplex。该模型的上线,标志着 AI 语音交互技术从传统的“单向回合制”正式迈向“实时自然交互”的新阶段,并已在抖音 App 上实现大规模用户部署。 核心突破:构建“听说同步”处理框架 Seeduplex 是字节跳动在端到端语音模型领域的一次重大架构升级。其核心优势在于打破了传统语音交互的滞后性,通过构建“听说同步”的底层处理框架,使 AI 能够实现真正意义上的全双工对话,交互体验更加贴近真人交流。 显著提升抗干扰与响应精度 针对复杂声学环境下的语音交互难题,Seeduplex 在性能上展现了多项关键优化: ●环境抗干扰能力: 通过对语音与语义进行联合建模,Seeduplex 在多人重叠对话、导航干扰及高噪声环境中表现出色,其误响应率和误中断率较半双工方案大幅降低了 50%。 ●动态停顿控制: 为精准把控对话节奏,该模型引入了动态停止技术,将停止延迟缩短约 250 毫秒,中断比例降低 40%。这使得模型能够灵敏区分用户的“思考停顿”与“对话结束”,从而避免对话过程中的尴尬中断。 ●工程化性能优化: 通过推测性采样和量化技术,Seeduplex 在保证高并发运行的同时,成功克服了计算延迟瓶颈,用户通话满意度绝对值提升了 8.34%。 行业影响:迈向感知与执行一体化 Seeduplex 的上线不仅是语音交互效率的提升,更代表了字节跳动在“感知、思考、执行一体化”路径上的重要探索。 [...] 字节跳动发布全双工语音大模型 Seeduplex 2026.04.10 | 785人看过 分享 [...] Seeduplex 的上线不仅是语音交互效率的提升,更代表了字节跳动在“感知、思考、执行一体化”路径上的重要探索。 业内分析指出,随着该技术在抖音 App 的全面落地,语音交互正在从单纯的工具指令转变为具备情感与节奏把控能力的智能伙伴。字节跳动未来计划引入视觉模态,将 Seeduplex 进一步进化为能够“听、看、想、说”的多维协作型通用智能体。这一演进方向预示着智能硬件与多模态交互行业的标准将被重塑,为用户提供更加沉浸式的 AI 使用体验。
字节发布全双工语音大模型 Seeduplex,豆包打电话能边听边讲、交流更自然|字节|it之家_新浪科技_新浪网finance.sina.com.cn · supporting### 官方微博 新浪科技 新浪数码 新浪手机 科学探索 苹果汇 新浪众测 ### 公众号 新浪科技 新浪科技为你带来最新鲜的科技资讯 苹果汇 苹果汇为你带来最新鲜的苹果产品新闻 新浪简介|广告服务|About Sina 联系我们|招聘信息|通行证注册 产品答疑|网站律师|SINA English Copyright © 1996-2026 SINA Corporation All Rights Reserved 新浪公司 版权所有 []( 新浪首页 新浪众测 语音播报 相关新闻 返回顶部 [...] 新浪首页 新闻 体育 财经 娱乐 科技 博客 图片 专栏 更多 汽车教育时尚女性星座健康 房产历史视频收藏育儿读书 佛学游戏旅游邮箱导航 新浪微博 新浪新闻 新浪财经 新浪体育 新浪众测 新浪博客 新浪视频 新浪游戏 天气通 []( []( []( 新浪科技> 数码 > 正文 # 字节发布全双工语音大模型 Seeduplex,豆包打电话能边听边讲、交流更自然 字节发布全双工语音大模型 Seeduplex,豆包打电话能边听边讲、交流更自然 2026年04月09日 12:47 IT之家 新浪财经APP 缩小字体 放大字体 收藏 微博 微信 分享 腾讯QQ QQ空间 IT之家 4 月 9 日消息,字节跳动今日宣布推出原生全双工语音大模型 Seeduplex。 据介绍,相比于上一代半双工豆包端到端语音模型,Seeduplex 基于“边听边说”的全新框架设计,交互体验的自然感、顺畅度大幅提升。 据官方介绍,Seeduplex 重点实现了以下两项突破: 多维度评测显示,Seeduplex 在对话的流畅度和节奏感上,均显著优于传统的半双工方案及行业主流 App 的语音通话功能;在判停表现上,模型相比半双工方案提升了 8%,展现出更接近自然对话的分寸感。 此外,大规模 A/B 实验数据显示,相比此前上线豆包的半双工模型,Seeduplex 在用户的通话时长、留存等核心指标上均实现正向提升,整体通话满意度绝对值提升了 8.34%,用户反馈中“抢话”、“响应慢”、“误打断”等问题的提及比例明显下降。 目前,Seeduplex 已在豆包 App 全量上线,豆包打电话能
团队动态 - 字节跳动Seedseed.bytedance.com · supporting# 原生音视频交互,走向全模态,实现边看、边听、边说 音视频实时交互此前长期卡在两种形态之间:级联系统依赖 ASR、VLM、TTS 等多个模块串联,延迟层层叠加,信息逐级损耗;端到端模型虽更流畅,但不少方案仍依赖外置 VAD 判断轮次,本质上仍接近一问一答的半双工交互。 SeedRealtime 的核心突破,在于将声音、画面、时序与表达统一到同一个端到端模型中。它不是先听完、再看完、最后作答,而是在连续音视频流上,让感知、理解、决策与表达同步进行,使“听到的”和“看到的”能够共同参与每一次实时判断。 难点首先在于对话节奏。语音天然带有停顿,可以借此判断何时接话;视频却始终在线、持续变化。模型既要不断理解画面中正在发生什么,又不能因为背景噪声干扰而频繁介入,而是要持续判断该关注哪个对象、该听谁说话,以及此刻是否应该回应。 更深层的挑战在于音视频的联合建模与时序对齐。用户说“这个怎么弄”时,模型需要结合当前画面、手势、视线与历史动作,判断“这个”具体指向什么;遇到同音词或模糊语音时,也要借助视觉场景完成消歧。只有将声音、画面与时序信息统一建模,模型才能真正把所见、所闻与所说对应起来。当看、听、说被纳入同一套实时决策体系,模型便不再只是等待用户提问,而能持续理解场景变化,在合适的时机主动开口。 接下来,我们通过 7 个具体案例,来看看 SeedRealtime 在真实场景中的表现。 # 音视频联合理解,看得懂画面,分得清对象 SeedRealtime 能在多人、嘈杂、开放的真实环境中,把画面、声音和时序对齐理解。 四位好友聚餐,人多话杂。用户逐一介绍在场的人,SeedRealtime 就能根据外形特征把名字和人对上 —— 认出浅色头发的七七、戴眼镜的 Julia,还主动和乐乐打招呼;在之后的交谈中,始终把每个人的声音和身份对应起来。 [...] # SeedRealtime 音视频全双工大模型发布:走向全模态自然交互 SeedRealtime 音视频全双工大模型发布:走向全模态自然交互 分类 模型发布 今天,我们正式推出原生音视频全双工大模型 SeedRealtime。 作为走向全模态交互的关键一步,SeedRealtime 用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来“边看、边听、边说”的全新体验。它实现了以下三项
字节跳动发布SeedRealtime音视频全双工大模型,可实现边看边听边说实时交互tech.ifeng.com · supporting字节跳动发布SeedRealtime音视频全双工大模型,可实现边看边听边说实时交互 科技 # 字节跳动发布SeedRealtime音视频全双工大模型,可实现边看边听边说实时交互 凤凰网科技讯(作者/于雷)8月5日,字节跳动正式发布原生音视频全双工大模型SeedRealtime,并宣布该模型已在豆包App全量上线。用户将豆包更新至最新版本后,可通过“打电话”功能进入视频通话界面,体验实时音视频AI交互。 SeedRealtime采用统一端到端架构,原生融合音频、视频和文本,支持模型在连续多模态信息流中同步完成感知、理解、决策与表达,实现“边看、边听、边说”的实时交互。与传统依赖ASR、视觉模型、TTS等多个模块串联的级联系统相比,该模型减少了多模块带来的延迟和信息损耗,也不再依赖外部VAD进行轮次判断。 字节表示,SeedRealtime实现了三项核心能力,包括音视频联合理解、主动交互能力以及更自然的对话节奏。模型能够结合画面、声音和时序信息理解用户意图,例如利用视觉信息消除同音词歧义、识别手势和指代对象,并持续跟踪画面变化,在目标出现时主动提醒用户。 在官方展示的多个应用案例中,模型能够在多人聚会中识别不同人物身份并持续对应发言者;帮助外国游客实时理解中文菜单和服务员介绍;在博物馆持续观察镜头画面,识别指定文物后主动提醒;辅助用户操作咖啡机并根据画面变化实时纠错;阅读论文时持续监测翻页过程,在指定章节出现后自动提示。 在复杂环境下,SeedRealtime还能根据多模态信息判断何时回应、何时保持沉默。官方演示显示,在机场等嘈杂场景中,模型能够区分用户与旁人对话,避免因背景噪声或无关聊天误触发回应;在儿童学习场景中,也能够持续跟随用户互动,不受背景电话等声音干扰。 [...] 字节披露的端到端人工评测结果显示,相比传统级联系统,SeedRealtime将音视频对话中的节奏问题减少约50%,包括抢话、回应延迟以及背景噪声误触发等情况均明显下降,同时单次对话能够完整、流畅进行的概率也有所提升。 字节表示,未来将继续优化模型的端到端时延、主动感知与决策能力、多人复杂场景理解能力以及工具调用能力,推动AI从传统问答交互进一步发展到能够在真实场景中持续理解环境并协助完成实际任务。 ## 亲爱的凤凰网用户: 您当前使用的浏览器版本过低,导致网站不能正常访问,建议
GPT-4o重磅来袭:免费开放最强多模态模型,可实时语音、视频对话 | OpenAI春季发布会解读youtube.com · supportingGPT-4o o是omni的简称 翻译过来的意思是全方位 代表着它是一个功能全面的原生 多模态模型 包含了文字图片语音视频为一体 而且最重要的是 它可以实时推理音频和视频 其实像我们之前在ChatGPT的APP上 已经是可以进行简单的语音交互了 但是它的体验不是很好 每一次对话 都要等待2到3秒的一个延时 这是因为呢 之前的对话逻辑 是由3个独立的模块组成的 首先呢要把用户的语音转换成文字 再用文字和GPT对话 GPT生成答案之后 再转换成语音输出给用户 在这种机制下 延时是没有办法避免的 而且呢还会丢失掉很多重要的信息 比如说像对话者的情绪 多人对话情景下还有背景声 这些都没有办法识别和处理 那么在输出方面也是一样的 他只有冰冷的音频输出 是没有任何情绪的 而GPT-4o 是一个全新的多模态模型 不管是在文本音频视频的处理 它都是端到端的 不需要做任何模态的转换 输入和输出 都是在同一个神经网络当中执行 所以它能做到实时的文字语音以及 视频的交互 首先我们可以看到 在整个对话过程当中 他的延时非常非常的低 据官方的数据表明 就只有200到300毫秒的一个延时 那这个几乎呢 是跟真人现场面对面对话 是没有任何区别的 其次呢我们可以看到GPT-4o 它的实时语音对话 它是带情绪的 并且它能很好的去识别 像用户的这个呼吸声喘息声 也就意味着像一些背景的声音 它都是能识别和处理的 好我们再来看第二个案例 第二个案例呢 是要求GPT-4o 给这个用户讲一个故事 好以上 就是本期视频的全部内容 感谢观看 如果你喜欢我的视频内容 欢迎订阅我的频道 每周都会更新最接地气的AI落地方案 和ChatGPT实用技巧 [...] 71 comments ### Transcript: [...] # GPT-4o重磅来袭:免费开放最强多模态模型,可实时语音、视频对话 | OpenAI春季发布会解读 ## AI学长小林 84800 subscribers 228 likes ### Description 18556 views Posted: 14 May 2024 【问题咨询&免费领取AI资料】微信:ailinplus 【我的AI课程】《ChatGPT实战指南》已开放,报名地址 🔽 【国际版地址】 【国内版地址】 【承接GPTs定制】 【我的博客】 【ChatGPT成品号】 (折扣