研究领袖敦促科技行业监控 AI 的”思维”

来自 OpenAI、Google DeepMind、Anthropic 以及广泛企业与非营利组织联盟的人工智能研究人员,在周二发布的立场文件中呼吁对监控 AI 推理模型所谓”思维”的技术进行更深入研究。
以 OpenAI 的 o3 和深度求索的 R1 为代表的 AI 推理模型,其关键特征在于思维链 (CoTs)——这是 AI 模型解决问题的外化过程,类似于人类用草稿纸演算数学难题的方式。推理模型是驱动 AI 智能体的核心技术,该文件作者认为,随着 AI 智能体日益普及且能力增强,思维链监控可能成为控制它们的重要方法。
研究人员在立场文件中表示:”思维链监控为前沿 AI 安全措施提供了宝贵补充,让我们罕见地窥见 AI 智能体的决策过程。但当前这种透明度能持续多久尚无保证。我们鼓励研究社区和前沿 AI 开发者充分利用思维链的可监控性,并研究如何维持这种特性。”
这份立场文件要求领先的 AI 模型开发商研究如何使思维链具备”可监测性”——即哪些因素能增强或削弱对 AI 模型真实推理过程的透明度。论文作者指出,监测思维链可能是理解 AI 推理模型的关键方法,但也强调这种监测可能具有脆弱性,警告任何可能降低其透明度或可靠性的干预措施都应避免。
论文作者还呼吁 AI 模型开发商追踪思维链的可监测性,并研究未来如何将这种方法作为安全措施加以实施。
这份文件的知名签署者包括 OpenAI 首席研究官马克·陈、安全超级智能公司 CEO 伊利亚·苏茨克沃、诺贝尔奖得主杰弗里·辛顿、谷歌 DeepMind 联合创始人谢恩·莱格、xAI 安全顾问丹·亨德里克斯以及 Thinking Machines 联合创始人约翰·舒尔曼。第一作者包括来自英国 AI 安全研究所和阿波罗研究的负责人,其他签署者则来自 METR、亚马逊、Meta 和加州大学伯克利分校。
这篇论文标志着人工智能行业众多领导者的一次团结行动,旨在推动 AI 安全领域的研究。当前科技公司正陷入激烈竞争——Meta 以百万美元报价从 OpenAI、Google DeepMind 和 Anthropic 挖走顶尖研究人员 。其中最炙手可热的研究人才正是那些开发 AI 智能体和推理模型的专家。
“我们正处于这个关键时刻,新型思维链技术刚刚出现。它看起来很有价值,但如果人们不真正重视,几年后可能会消失,”参与论文撰写的 OpenAI 研究员鲍文·贝克在接受 TechCrunch 采访时表示,”发布这样的立场文件,对我来说是在这种情况发生前吸引更多研究和关注的有效机制。”
OpenAI 于 2024 年 9 月公开了首个 AI 推理模型 o1 的预览版。此后数月间,科技行业迅速推出了具备相似能力的竞品,Google DeepMind、xAI 和 Anthropic 的某些模型甚至在基准测试中展现出更优异的性能。
然而,人们对 AI 推理模型的工作原理仍知之甚少。尽管过去一年 AI 实验室在提升 AI 性能方面表现出色,但这并不等同于更深入地理解它们如何得出答案。
Anthropic 一直是业界探索 AI 模型真实运作机制(该领域称为”可解释性”)的领军者之一。今年早些时候,其 CEO 达里奥·阿莫迪宣布承诺在 2027 年前破解 AI 模型的黑箱并加大对可解释性的投入。他还呼吁 OpenAI 和谷歌 DeepMind 也加强这方面的研究。
Anthropic 的早期研究表明, 思维链可能无法完全可靠地反映这些模型得出答案的过程。与此同时,OpenAI 研究人员表示,思维链监测未来或许能成为追踪 AI 模型一致性与安全性的可靠方法 。
此类立场文件的目的在于提升关注度,吸引更多研究者投身思维链监控等新兴领域。尽管 OpenAI、Google DeepMind 和 Anthropic 等公司已开展相关研究,但这份文件或将推动该领域获得更多资金投入和研究力量。