深度文章
2025.07.16 02:42 约 4 分钟 企业级应用 持续阅读

研究领袖敦促科技行业监控 AI 的”思维”

RECODEX · 深度文章 企业级应用

People walking in a maze shaped as a brain

来自 OpenAI、Google DeepMind、Anthropic 以及广泛企业与非营利组织联盟的人工智能研究人员,在周二发布的立场文件中呼吁对监控 AI 推理模型所谓”思维”的技术进行更深入研究。

以 OpenAI 的 o3 和深度求索的 R1 为代表的 AI 推理模型,其关键特征在于思维链 (CoTs)——这是 AI 模型解决问题的外化过程,类似于人类用草稿纸演算数学难题的方式。推理模型是驱动 AI 智能体的核心技术,该文件作者认为,随着 AI 智能体日益普及且能力增强,思维链监控可能成为控制它们的重要方法。

研究人员在立场文件中表示:”思维链监控为前沿 AI 安全措施提供了宝贵补充,让我们罕见地窥见 AI 智能体的决策过程。但当前这种透明度能持续多久尚无保证。我们鼓励研究社区和前沿 AI 开发者充分利用思维链的可监控性,并研究如何维持这种特性。”

这份立场文件要求领先的 AI 模型开发商研究如何使思维链具备”可监测性”——即哪些因素能增强或削弱对 AI 模型真实推理过程的透明度。论文作者指出,监测思维链可能是理解 AI 推理模型的关键方法,但也强调这种监测可能具有脆弱性,警告任何可能降低其透明度或可靠性的干预措施都应避免。

论文作者还呼吁 AI 模型开发商追踪思维链的可监测性,并研究未来如何将这种方法作为安全措施加以实施。

这份文件的知名签署者包括 OpenAI 首席研究官马克·陈、安全超级智能公司 CEO 伊利亚·苏茨克沃、诺贝尔奖得主杰弗里·辛顿、谷歌 DeepMind 联合创始人谢恩·莱格、xAI 安全顾问丹·亨德里克斯以及 Thinking Machines 联合创始人约翰·舒尔曼。第一作者包括来自英国 AI 安全研究所和阿波罗研究的负责人,其他签署者则来自 METR、亚马逊、Meta 和加州大学伯克利分校。

这篇论文标志着人工智能行业众多领导者的一次团结行动,旨在推动 AI 安全领域的研究。当前科技公司正陷入激烈竞争——Meta 以百万美元报价从 OpenAI、Google DeepMind 和 Anthropic 挖走顶尖研究人员 。其中最炙手可热的研究人才正是那些开发 AI 智能体和推理模型的专家。

“我们正处于这个关键时刻,新型思维链技术刚刚出现。它看起来很有价值,但如果人们不真正重视,几年后可能会消失,”参与论文撰写的 OpenAI 研究员鲍文·贝克在接受 TechCrunch 采访时表示,”发布这样的立场文件,对我来说是在这种情况发生前吸引更多研究和关注的有效机制。”

OpenAI 于 2024 年 9 月公开了首个 AI 推理模型 o1 的预览版。此后数月间,科技行业迅速推出了具备相似能力的竞品,Google DeepMind、xAI 和 Anthropic 的某些模型甚至在基准测试中展现出更优异的性能。

然而,人们对 AI 推理模型的工作原理仍知之甚少。尽管过去一年 AI 实验室在提升 AI 性能方面表现出色,但这并不等同于更深入地理解它们如何得出答案。

Anthropic 一直是业界探索 AI 模型真实运作机制(该领域称为”可解释性”)的领军者之一。今年早些时候,其 CEO 达里奥·阿莫迪宣布承诺在 2027 年前破解 AI 模型的黑箱并加大对可解释性的投入。他还呼吁 OpenAI 和谷歌 DeepMind 也加强这方面的研究。

Anthropic 的早期研究表明, 思维链可能无法完全可靠地反映这些模型得出答案的过程。与此同时,OpenAI 研究人员表示,思维链监测未来或许能成为追踪 AI 模型一致性与安全性的可靠方法 

此类立场文件的目的在于提升关注度,吸引更多研究者投身思维链监控等新兴领域。尽管 OpenAI、Google DeepMind 和 Anthropic 等公司已开展相关研究,但这份文件或将推动该领域获得更多资金投入和研究力量。

订阅 RecodeX 创投情报 每日融资动态与原创深度报道,直达邮箱

了解 RecodeX 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读