RecodeX 重构消息,近期国内一批AI模型厂商密集启动“预训练返工”,核心原因是训练数据质量不达标。有厂商此前投入一年研发万亿参数模型,落地表现却被规模仅1%的小模型反超,最终定位为脏数据拖累;也有厂商因标注规则模糊、评测集污染、垃圾语料冗余导致进展迟缓,或受数据限制遭遇性能瓶颈后推倒重来并重建数据团队。

业内反映,数据在AI训练预算中占比偏低,粗略拆解为算力40%、人才30%、广告20%、数据仅10%。高质量数据产能不足,部分厂商通过API中转站截留用户交互轨迹、做数据蒸馏以获取真实任务样本。