8月5日,据字节跳动Seed官方消息,原生音视频全双工大模型SeedRealtime今日正式发布。该模型核心亮点是将声音、画面、时序与表达统一到同一个端到端模型中,摒弃传统模型先完整接收音视频信息再生成回复的运行逻辑,实现感知、理解、决策与表达同步并行。

据介绍,SeedRealtime是走向全模态交互的关键一步,在业界率先实现了音视频全双工技术的规模化落地,依托统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来“边看、边听、边说”的全新体验。目前, SeedRealtime已在豆包App全量上线。
SeedRealtime实现了三大突破:音视频联合理解、主动的交互能力、流畅的交互节奏。

端到端人工评测数据显示,对比级联式多模态模型,SeedRealtime的对话节奏违和问题降低五成,大幅改善中途抢话、回复延迟、噪音误触发等常见卡顿问题,完整顺畅完成一轮对话的概率明显提升。
丁丁打折网©版权所有,未经许可严禁复制或镜像 ICP证: 湘ICP备2023003002号-11
Powered by 丁丁打折网本站为非营利性网站,本站内容均来自网络转载或网友提供,如有侵权或夸大不实请及时联系我们删除!本站不承担任何争议和法律责任!
技术支持:丁丁网 dddazhe@hotmail.com & 2010-2020 All
rights reserved