新型 AI 模型让数据所有者重掌控制权
艾伦人工智能研究所提出了一种新方法,即使数据已被用于训练人工智能模型,也能将其从中移除。

艾伦人工智能研究所(Ai2)的研究人员开发出一种新型大语言模型 ,即使在模型构建完成后,仍能实现对训练数据使用方式的控制。
这款名为 FlexOlmo 的新模型可能挑战当前行业范式——大型人工智能公司通常肆意抓取网络、书籍等来源的数据( 几乎不考虑所有权问题 ),然后完全掌控最终训练出的模型。在现行模式下,数据一旦被融入 AI 模型,想要从中提取原始数据就如同试图从烤好的蛋糕里还原出鸡蛋。
“传统模式下,你的数据要么被纳入训练,要么被排除在外,”总部位于华盛顿州西雅图的 Ai2 公司首席执行官阿里·法哈迪解释道,“一旦我用这些数据完成训练,你就失去了控制权。除非你迫使我再投入数百万美元重新训练,否则别无选择。”
Ai2 的前沿方法将训练过程分解,使数据所有者能够掌握控制权。想要为 FlexOlmo 模型贡献数据的人,可以先复制一个名为‘锚点’的公开共享模型,然后用自己的数据训练第二个模型,将结果与锚点模型结合,最后将合并后的成果反馈给构建第三个最终模型的主体。
这种贡献方式意味着原始数据始终无需移交。由于数据所有者的模型是以特定方式与最终模型融合的,后续仍有可能提取原始数据。例如,某杂志出版商可能将文章档案中的文本贡献给模型,但若发生法律纠纷或公司反对模型使用方式,后续可移除基于该数据训练的子模型。
“训练过程完全异步化,”领导这项技术工作的 Ai2 研究科学家 Sewon Min 表示,”数据所有者无需协调,训练可以完全独立进行。”
FlexOlmo 模型架构采用了所谓的”专家混合”设计——这种流行方案通常用于将多个子模型同步组合成更强大模型。Ai2 的关键创新在于能够合并独立训练的子模型,这通过一种新型数值表征方案实现,使得模型能力在最终组合运行时能与其他模型融合。
为验证该方法,FlexOlmo 研究团队从书籍网站等专有数据源创建了名为 Flexmix 的数据集。他们运用 FlexOlmo 架构构建了包含 370 亿参数的模型(约为 Meta 最大开源模型规模的十分之一),并通过多组对比测试发现:该模型在所有任务中均优于单一模型,在常见基准测试中比其他两种独立训练模型合并方案高出 10%的性能表现。
最终实现的效果是鱼与熊掌兼得。”你可以随时退出系统而不会造成重大损害或影响推理时间,”法哈迪说,”这彻底改变了我们训练这类模型的思维方式。”
斯坦福大学人工智能研究员 Percy Liang 表示,Ai2 的方法看起来是个很有前景的创意。”对数据提供更模块化的控制——尤其是不需要重新训练——这种创新方向挑战了将语言模型视为单一黑箱的现状,”他说,”开发过程的开放性——模型如何构建、进行了哪些实验、决策如何制定——这些是目前缺失的环节。”
法哈迪和闵指出,FlexOlmo 方法或许还能让 AI 公司以更可控的方式访问敏感隐私数据,因为构建最终模型时无需公开这些数据。但他们也警告说,从最终模型中重构数据是有可能的,因此可能需要采用差分隐私这类技术来确保数据安全——该技术通过数学方法保障数据贡献过程中的隐私性。
近年来,用于训练大型 AI 模型的数据所有权已成为重大法律议题。部分出版商正起诉大型 AI 企业,另一些则通过协议开放内容使用权(WIRED 母公司康泰纳仕已与 OpenAI 达成合作协议 )。
今年六月,Meta 在一起重大版权诉讼中胜诉 ,联邦法官裁定该公司使用 13 位作家书籍文本训练开源模型的行为未构成违法。
闵(Min)认为采用 FlexOlmo 方法很可能构建新型开源模型。”我始终认为数据是构建尖端模型的瓶颈,”她表示,”这种方式能创建更优质的共享模型,让不同数据所有者可以协同开发,同时不必牺牲数据隐私或控制权。”