RecodeX 重构消息,相关研究提出OmniVChat原生音视频对话框架,针对现有音视频交互多为音视频问答、缺乏无需文本或ASR转写的原生音视频对话能力的问题。该框架通过多智能体数据引擎OmniVChat-Studio合成带参考回复与评分标准的单轮、多轮原生音视频对话数据,并构建覆盖5大能力类别的2800条评测基准OmniVChat-Bench,同时将分层评分标准转化为强化学习奖励设计OmniVChat-RL。实验显示,仅用合成对话做强化学习,模型在完全未参与训练的真人真实交互数据集上表现也显著提升。