RecodeX 重构消息,研究团队推出基于Qwen3-VL-8B-Instruct的VideoGen-Agent多模态智能体,可自主调用检索、生成、验证等工具完成视频生成任务。该智能体先通过监督微调建立工具使用能力,再经多任务强化学习优化决策过程。
在自研的600条提示词、覆盖六类能力的VABench基准测试中,其Toolset 1配置得分75.6,较基础视频生成器提升19.1分;升级生成工具后得分达86.1,且无需重训智能体策略。人类评估中,84.3%的受访者更偏好其生成结果。
该智能体可自主组合工具处理未见过的复合生成需求,并能扩展接入新工具链,适配机器人操作视频生成等场景。