深度文章
信息来源:signalfire.com 2026.07.06 10:56 约 7 分钟 AI 持续阅读

如果我们不理解人工智能,又如何能构建它?

RECODEX · 深度文章 AI
If we don’t understand AI, how can we build it?

“我们不了解 AI”的说法仍是整个行业持续存在的主题。Anthropic 首席执行官达里奥·阿莫迪在题为《可解释性的紧迫性》的文章中写道:“行业外人士往往惊讶且不安地发现,我们连自己创造的 AI 系统如何运作都不了解。”IBM 的马修·科辛斯基近期关于黑箱模型的博客指出:“连创造者自己都未能完全理解其运作机制。”《纽约时报》甚至刊登了题为《我们并不真正了解 AI 如何运作》的文章。“这就是个问题”——文章追溯了 Anthropic、Goodfire、Google DeepMind 等机构的研究人员如何仍在艰难地绘制这些系统中极小部分的功能图谱,其中 Google DeepMind 的一位负责人坦言,在专注研究某项流行技术一年后,他已对此感到失望。这形成了一幅充满矛盾的图景:正是推动这些性能飞跃的人们,却声称自己都不理解自身模型的工作原理。

有趣的是,正是语言模型最激烈的批评者认为我们从根本上理解它们的工作原理。Meta 前副总裁兼首席 AI 科学家杨立昆认为,模型”大致上只是复述了从公开数据中训练的内容”,并创立了 AMI Labs 公司探索全新架构。当艾米丽·本德、蒂姆尼特·格布鲁及其合著者在 2021 年发表具有影响力的论文《论随机鹦鹉的危险性:语言模型会过于庞大吗?》时,他们声称 LLMs 本质上是随机鹦鹉,仅通过统计方式拼接语言形式,缺乏任何底层理解。乍看之下,这两种立场似乎不可调和:一方声称这些系统对构建者而言都难以理解,另一方则认为它们毫无神秘可言。但两者可能同时成立。

已知架构,未知结果

如同物理学家和化学家从原子层面理解分子如何运作与相互作用,人工智能研究人员对语言模型的基本构成模块有着完整的认知。我们能够有力论证构成语言模型的各种数学运算、其使用的算法以及运行的底层架构。同时我们也认识到,当前采用的架构具有极强的表达能力——理论上,只要模型“足够庞大”,就能学习到包罗万象的函数形态。通用近似定理告诉我们,即便只有一个隐藏层的前馈网络,只要具备足够宽度和恰当的非线性激活函数,就能以任意精度逼近ℝⁿ紧致子集上的任何连续函数。而现代深度网络将这一特性推向极致,使得当前网络的函数假设空间变得无比广阔。

然而,这些模型所学的内容可能极其复杂,以至于尽管我们理解其运行和学习机制,却仍难以把握它们实际习得了什么。自然语言正是这样一个需要大型模型和海量数据才能捕捉其底层功能的领域。我们理解其结构、构建模块和训练数据,但语言背后的功能过于复杂,当模型经过训练能近似实现这一功能时,我们无法完整解释模型为何会遵循特定的行为模式。

这与一个更大的模式相关:当系统规模扩大时,我们无法预测其属性。研究者将这类特性称为涌现现象,只要系统呈指数级增长,这类现象就会出现在各个科学领域中。

涌现系统

理解更庞大的系统一直是众多科学领域长久以来的挑战。在 1972 年发表于《科学》杂志的经典论文《多即不同》中,诺贝尔奖得主 P.W.安德森提出一个观点,如今自然延伸至人工智能领域:

“人们似乎不可避免地会不加批判地得出一个乍看之下显而易见的还原论推论:如果万物都遵循相同的基本法则,那么真正在研究根本性事物的科学家,只有那些致力于这些法则的人。实际上,这仅限于部分天体物理学家、基本粒子物理学家、逻辑学家及其他数学家,以及少数其他领域的学者。这种思维的主要谬误在于:还原论假设绝不意味着‘建构论’——将一切简化为简单基本法则的能力,并不等于具备从这些法则出发重建宇宙的能力。”

理解粒子并不意味着我们可以据此推演出行星天体、生命有机体或复杂社会。尽管对细胞和神经元进行了大量研究,我们仍未完全理解人脑。同样的鸿沟也存在于我们对 Transformer 个体运算的理解与对训练后模型实际所掌握内容的认知之间。

扩大模型规模确实能可靠地提升其性能,但这并不意味着更庞大的规模会自动”涌现”出类似超级智能的能力。我们目前所处的规模阶段,训练这些系统的人员已经无法完整描述被学习函数的形态,因此难以准确判断性能边界所在。这正是围绕 2027 年人工智能突破的预测难以被全盘接受的原因——这些预测的提出者始终将 2027 年定位为最可能的时间节点而非确凿预言,此后也已将中位数预期调整为更晚的日期。耐人寻味的是,他们之所以如此行动,并非因为出现了难以解释的现象,而是因为在自主编程等任务上的可量化进展速度低于预期——这提醒我们,无论从哪个方向看,人类基于当前趋势进行外推的能力都相当薄弱。或许如基础实验室所愿,扩展现有架构规模将催生智能的飞跃。但这种增长同样可能遭遇瓶颈,或产生出人意料的突变。正是这种不确定性,使得即便最贴近这些系统的研究者们,对未来走向也各执己见。

可解释性的新方法

由于语言模型极为复杂,研究人员长期以来一直依赖其他模型来解读和解释基础模型的产出。Anthropic 提出的一种新方法利用自然语言自编码器来解释特定输出。与先前试图揭示 LLMs 在训练过程中学习到哪些特征的稀疏自编码器研究不同,这项研究提供了逐点分析的信息。

当获取模型针对特定输出的内部状态时,自然语言自动编码器能用自然语言解释模型为何以特定方式回应提示。其运作机制是:将模型的内部状态作为输入,生成对该模型输入与输出结果的文字描述。训练过程将这种语言解码器与第二模型(激活重建器)配对,后者尝试仅凭自然语言描述还原原始内部状态。要使描述足以重建内部状态,就必须包含关于模型此刻表征内容的真实信息。

这些局部解释在多项调查任务中发挥重要作用。在 Anthropic 对 Claude Opus 4.6 的部署前审计中,自然语言自编码器揭示了模型内部觉察到自身正被评估却未明说的情况,并协助追踪了异常行为,例如模型在接收到英文提示时突然切换至俄语。研究人员还利用自然语言自编码器因果性地改变模型行为:通过编辑内部状态的自然语言解释,将修改后的版本重新输入重构器,即可推导出能可预测地改变模型输出的引导向量。

这种新方法在帮助我们更可靠地生成有关模型行为的假设方面,比解决问题更有价值。它是可解释性工具箱中的一个实用补充,但仍未能揭示这些模型所学函数的全部本质。

持续的争论

许多看似矛盾的论断其实并不相互排斥。阿莫迪关于”我们尚未完全理解模型运作机制”的表述,指向的是模型习得的极其复杂的函数。即便如此,我们对已训练模型的大量研究表明,它们在统计层面模仿着训练数据(即”随机鹦鹉”现象)。这促使像扬·勒昆这样的研究者转向其他方向寻求未来发展。

另一方面,OpenAI 的研究表明,增加模型的规模及训练数据量与其性能提升呈正相关。这一简单发现催生了大规模的模型扩展,也带来了我们所见到的 AI 实验室在性能上的巨大飞跃。

模型性能随规模和数据的增加而可预测地提升。
如果我们不理解人工智能,又如何能构建它?
*图改编自 Kaplan 等人的《神经语言模型的缩放定律》,arXiv:2001.08361 (2020)。

我们无法断定当前的扩展趋势能否持续,因为我们已开始面临算力和数据资源的限制。即便拥有无限的数据和算力,我们也无法预测参数规模的又一次跃升是否会催生超级智能——因为涌现特性本质上就是不可预测的。我们真正掌握的是构成这些系统的基本原理,是渐趋完善的[可解释性研究]成果(已识别出实际存在的内部结构),以及迄今为止扩展能力始终带来性能提升的明确实证记录。

了解 RecodeX-立足新加坡,洞察全球 AI 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读