事件追踪 · 持续发展中

AI预训练数据返工

持续追踪AI预训练数据返工相关报道与进展。

我的关注 →RSS 订阅
关注仅保存在当前浏览器和域名中,无需登录,不会自动跨设备同步。

事件时间线

按最新发布排序

持续追踪AI预训练数据返工相关报道与进展。

投资界消极

国内多家AI模型厂商密集启动预训练返工,脏数据拖累万亿参数模型

RecodeX 重构消息,近期国内一批AI模型厂商密集启动“预训练返工”,核心原因是训练数据质量不达标。有厂商此前投入一年研发万亿参数模型,落地表现却被规模仅1%的小模型反超,最终定位为脏数据拖累;也有厂商因标注规则模糊、评测集污染、垃圾语料冗余导致进展迟缓,或受数据限制遭遇性能瓶颈后推倒重来并重建数据团队。

业内反映,数据在AI训练预算中占比偏低,粗略拆解为算力40%、人才30%、广告20%、数据仅10%。高质量数据产能不足,部分厂商通过API中转站截留用户交互轨迹、做数据蒸馏以获取真实任务样本。