RecodeX 重构消息,复旦大学CVL实验室提出面向复杂人类中心场景的音视频追踪基准AVTrack,相关论文已被ICML 2026接收,项目主页、论文、代码与数据集均已公开。该基准包含871段平均时长54.0秒的视频,提供3120条带跨帧身份的像素级实例轨迹,覆盖剧集、vlog等六类来源,设为纯测试基准,并划分视觉遮挡、音视频不一致等8类挑战场景。团队对代表性VIS、AVIS方法及Gemini 2.5 Pro进行测试,发现现有方法在复杂场景中表现不佳,通用大模型的音视理解能力难以直接转化为稳定的像素级说话人跟踪能力。其提出的模块化模型AVTracker通过局部到整体三阶段设计,在HOTA指标上取得最优表现,但音视频不一致、视觉遮挡等场景仍是难点。