字节跳动 Seed 团队原生音视频全双工大模型 SeedRealtime 正式发布,
豆包不再只是“打字聊天”的 AI,而是能看见你、听懂你、主动回应你的视频通话助手。
豆包是字节跳动公司基于云雀模型研发的 AI 对话产品,由北京春田知韵科技有限公司开发。作为国内用户规模领先的 AI 助手,豆包以“全模态自然交互”为核心理念,将语音、视觉与文本能力融入同一对话空间。2026 年 8 月 4 日,字节跳动 Seed 团队正式推出原生音视频全双工大模型 SeedRealtime,并在豆包 App 全量上线,在业界率先实现了音视频全双工技术的规模化落地。这意味着豆包不再只是“打字聊天”的 AI,而是能像真人一样视频通话的 AI 助手。豆包官网为 www.doubao.com,App 可在各大应用商店搜索“豆包”免费下载。
豆包由字节跳动公司基于云雀模型研发,北京春田知韵科技有限公司开发。依托字节跳动在 AI 领域的技术积累,豆包持续迭代,为用户提供稳定、流畅、智能的对话体验。
SeedRealtime 将声音、画面、时序与表达统一到同一个端到端模型中,让感知、理解、决策与表达同步进行。相比级联模型,音视频对话节奏问题减少了一半。
边看、边听、边说,像真人聊天一样自然。豆包能认出画面中的人、分清谁在说话、在合适时机主动开口,把所见、所闻与所说对应起来。
豆包网页端与 App 内基础功能完全免费,不包含任何广告和付费项目。搭载豆包大模型系列,支持联网搜索、文件上传、文档处理等完整能力。
豆包提供覆盖日常办公与创作场景的完整 AI 工具矩阵。无论是快速问答、文章撰写、图像生成,还是 PDF、Word、Excel、PPT 文档处理,都可以在同一个入口内完成。基础功能完全免费,不包含任何广告和付费项目,免费用户即可体验办公任务模式。2026 年 6 月推出的豆包专业版提供更高的复杂工作场景使用额度,标准套餐 68 元/月,大学生 38 元/月,供有更高频需求的用户选择。
日常问答、知识查询、创意脑暴。搭载豆包大模型系列,支持联网搜索,回复及时、表达自然。
免费使用文章撰写、润色改写、摘要提炼、邮件起草,覆盖办公与学习场景,帮你更快完成文字工作。
免费使用根据文字描述生成图像,支持多种风格与尺寸。无论是配图、海报还是创意视觉,都能快速出图。
免费使用支持上传图像、PDF、Word、Excel、PPT 等文件,快速提取信息、总结要点、回答基于文档的问题。
免费使用SeedRealtime 全双工大模型加持,边看边听边说,像真人聊天一样自然。App 端免费开放。
App 端体验免费用户也可体验办公任务模式,处理文档、整理表格、生成汇报材料,提升日常工作效率。
免费体验豆包是字节跳动公司基于云雀模型研发的 AI 对话产品,由北京春田知韵科技有限公司开发。作为国内用户规模领先的 AI 助手,豆包网页端与 App 内基础功能完全免费,不包含任何广告和付费项目。
2026 年 8 月 4 日,字节跳动 Seed 团队正式推出原生音视频全双工大模型 SeedRealtime,并在豆包 App 全量上线,在业界率先实现了音视频全双工技术的规模化落地。这意味着豆包不再只是“打字聊天”的 AI,而是能像真人一样视频通话的 AI 助手。
SeedRealtime 用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互。端到端人工评测显示,相比级联模型,对话节奏问题减少了一半——“话未说完被抢断、话音已落却回应迟缓、被背景杂音误触发”等卡壳现象显著减少。
豆包官网为 www.doubao.com,App 可在各大应用商店搜索“豆包”免费下载。用户将豆包 App 更新至最新版本后,在对话框内选择“打电话”,进入视频通话界面,即可体验“边看、边听、边说”的全模态交互。
目前,SeedRealtime 已在豆包 App 全量上线。业界首个实现音视频全双工规模化落地的方案,选择了日活超过 2 亿的豆包 App 作为首个消费端入口。
豆包基础功能完全免费,搭载豆包大模型系列,支持联网搜索、文件上传(图像、PDF、Word、Excel、PPT 等)。2026 年 6 月推出的豆包专业版提供更高的复杂工作场景使用额度,免费用户也可体验办公任务模式。
四位好友聚餐,人多话杂。用户逐一介绍在场的人,SeedRealtime 就能根据外形特征把名字和人对上——认出浅色头发的七七、戴眼镜的 Julia,还主动和乐乐打招呼;在之后的交谈中,始终把每个人的声音和身份对应起来。
在多人交错对话流里,SeedRealtime 同时完成认人、辨声、理解,分清发言主体,把握讨论要点,并在合适时机接话和给出建议。
在川菜馆,外国食客面对中文菜单犯难。SeedRealtime 识别菜品、用英文推荐,还能解释“鱼香肉丝为什么没有鱼”的文化背景。
大家你一言我一语聊起旅行:有人想去海边拍照、有人怕热怕累、有人对海鲜过敏。SeedRealtime 能分辨每句话出自谁,并根据大家的交流,给出一份兼顾每个人需求的旅行方案。认人、辨声、听懂各自的需求,这些都在同一场对话里由一个模型实时完成。
SeedRealtime 具备持续的环境感知与主动表达能力。模型能在察觉画面状态变化时(如关键目标出现)主动提醒,并能调用工具融入表达,让交互从被动响应升级为主动协作。
在博物馆等移动场景中,SeedRealtime 能持续关注用户目标,适时主动提醒并结合实时画面自然讲解,同时屏蔽无关干扰,保持流畅交互。
在设备操作场景中,模型能持续观察用户行动过程,主动发现问题、及时纠错,并结合结果给出针对性建议。
SeedRealtime 能够实时感知用户的对话状态与交流节奏,在适当时机自然接话、停顿与回应;同时具备较强的抗干扰能力,能分辨旁人闲聊与背景噪声,不因干扰误触发,保持沟通的流畅连贯。端到端人工评测结果显示:相比级联模型,SeedRealtime 的音视频对话节奏问题减少了一半——“话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等卡壳现象显著减少;同时,单次对话能够顺畅、完整交流的概率也有明显提升。
音视频实时交互此前长期卡在两种形态之间:级联系统依赖 ASR、VLM、TTS 等多个模块串联,延迟层层叠加,信息逐级损耗;端到端模型虽更流畅,但不少方案仍依赖外置 VAD 判断轮次,本质上仍接近一问一答的半双工交互。
SeedRealtime 的核心突破,在于将声音、画面、时序与表达统一到同一个端到端模型中。它不是“先听完、再看完、最后作答”,而是在连续音视频流上,让感知、理解、决策与表达同步进行。
用户说“这个怎么弄”时,模型需要结合当前画面、手势、视线与历史动作,判断“这个”具体指向什么;遇到同音词或模糊语音时,也要借助视觉场景完成消歧。
只有将声音、画面与时序信息统一建模,模型才能真正把所见、所闻与所说对应起来。当看、听、说被纳入同一套实时决策体系,模型便不再只是等待用户提问,而能持续理解场景变化,在合适的时机主动开口。
日常问答、知识查询、创意脑暴,搭载豆包大模型系列,支持联网搜索。
文章撰写、润色改写、摘要提炼,覆盖办公与学习场景。
根据文字描述生成图像,支持多种风格与尺寸。
支持上传图像、PDF、Word、Excel、PPT 等文件,快速提取信息、总结要点。
SeedRealtime 全双工大模型加持,边看边听边说,像真人聊天一样自然。App 端免费开放。
标准套餐 68 元/月,大学生 38 元/月。提供更高复杂工作场景使用额度,免费用户也可体验办公任务模式。
边看 · 边听 · 边说,像真人聊天一样自然
⬇ 免费下载豆包 App