
Qzone
微博
微信
近日,豆包正式推出升级版视频通话功能,全面集成自主研发的原生音视频全双工大模型SeedRealtime。该模型专为实时音视频交互场景设计,首次在大规模应用中实现真正意义上的音视频全双工能力。
据机锋网了解,SeedRealtime具备音视频联合理解能力,可同步处理声音信号、视觉画面与时间序列信息,精准识别当前发言对象,智能判断应倾听、应回应或宜静默的时机,从而支持边看、边听、边说的自然连续对话体验。在真实动态环境中,该模型显着提升了视频通话的交互自然度与响应连贯性。
技术层面,SeedRealtime实现了三项关键突破。其一,深度融合多模态信息,将语音、图像及时间维度数据协同建模,在复杂语境下消除同音歧义,并准确解析画面中具有时序指向性的动作或对象。其二,具备主动交互意识,持续感知环境变化,当画面中出现状态切换或关键目标时,可自主发起提示并灵活调用相关功能模块辅助表达。其三,优化对话节奏控制,实时分析用户语音停顿、语速变化及非语言线索,动态选择最适宜的介入时机,同时对环境干扰具备较强鲁棒性,能有效区分用户主述、他人旁白及背景杂音,大幅降低误触发率。
对用户而言,此次升级意味着视频通话将从“你问我答”的被动交互转向更接近真人对话的双向协作体验。豆包通过SeedRealtime的落地,也为端侧AI实时交互场景树立了新的技术标杆,后续该模型在更多智能设备上的应用表现仍待观察。
【以上内容转自“机锋网”,不代表本网站观点。 如需转载请取得机锋网许可,如有侵权请联系删除。】
延伸阅读: