返回首页
2025.07.20 05:34 约 15 分钟 深度学习 1.4万 阅读

V 神:我对 AI 2027 的回应

本文信息来源:vitalik

特别感谢 Balvi 志愿者的反馈与审阅

今年四月,Daniel Kokotajlo、Scott Alexander 等人发布了他们称之为”代表我们对[未来五年超人类 AI 影响]最合理猜测的情景推演”。该推演预测到 2027 年我们将造出超人类 AI,而人类文明的整个未来都取决于其发展结果:到 2030 年我们将迎来(从美国视角看)乌托邦或(从全人类视角看)彻底灭绝。

此后数月间涌现了大量回应,对其提出的情景可能性持有不同观点。例如:

在关键回应中,多数讨论聚焦于快速发展时间线的问题:AI 进步是否会如 Kokotajlo 等人所言持续加速?这场争论已在 AI 领域持续数年,许多人对超人类 AI 会如此迅速到来持强烈怀疑态度。最近,AI 能完全自主执行的任务时长正以每七个月翻倍的速度增长。若假设该趋势无限持续,到 2030 年代中期,AI 将能自主运作相当于人类整个职业生涯的时间。这仍是极快的发展速度,但比 2027 年慢得多。持长期时间线观点者通常认为,当前 LLMs 的”插值/模式匹配”与人类独有的”外推/真正原创思考”存在本质差异 ,而后者的自动化可能需要我们目前甚至不知如何着手开发的技术。 或许我们只是在重演计算器首次大规模普及时的误判——错误地认为既然已经快速自动化了一类重要认知能力,其他领域也会很快跟进。

本文不会直接参与时间线的争论,甚至不会触及(极其重要的)关于超级智能 AI 是否天生危险的辩论。不过需要说明的是,我个人预测的时间线比 2027 年更长远,且本文提出的论点会随着时间线的延长而更具说服力。总体而言,本文将从一个独特角度展开批判:

《AI 2027》情景隐含了一个前提:领先 AI(Agent-5 及后续的 Consensus-1)的能力会急速提升,直至获得近乎神明的经济与毁灭力量,而其他所有主体(的经济与防御能力)却基本停滞不前。这与该情景自己在信息图中承认的内容相矛盾——即使在悲观情境下,到 2029 年我们也应该能看到癌症乃至衰老被治愈,意识上传技术实现 

我在本文中描述的一些对策,读者可能会觉得在技术层面可行,但短期内难以在现实世界部署。多数情况下我认同这种看法。然而,《AI 2027》情景设定的并非当今现实世界,而是假设四年后(或任何可能发生末日的时间框架内)人类将掌握远超当前水平的技术力量。那么让我们看看,当对抗双方都获得 AI 超能力时会发生什么。

生物末日远非情景描述中那般板上钉钉

让我们聚焦”竞赛”情景(即美国因过度关注击败中国而忽视人类安全,导致全体灭亡的设定)。以下是导致全体灭亡的关键环节:

约三个月时间里,共识 1 号围绕人类扩张,在草原和冰盖上铺满工厂与太阳能板。最终它发现残余人类仍是巨大阻碍:2030 年中期,AI 在主要城市投放十余种静默传播的生物武器,任其悄然感染绝大多数人后,用化学喷雾激活病原体。数小时内多数人毙命;少数幸存者(如地堡中的末日准备者、潜艇里的船员)被无人机肃清。机器人扫描死者大脑,将副本存入存储器供未来研究或复活之用。

让我们剖析这个场景。即便当前 ,正在发展的多项技术已能大幅削弱 AI 这种”完胜”的可能性:

  • 空气过滤系统、通风设备与短波紫外线能被动大幅降低空气传播疾病感染率
  • 各类实时被动检测技术的两种应用 病例:
    • 在数小时内被动检测某人是否被感染并通知他们。
    • 快速检测环境中尚未被识别的新病毒序列(PCR 技术无法实现这一点,因为它依赖扩增已知序列,但更复杂的技术可以做到)。
  • 多种增强和激活免疫系统的方法,比新冠疫苗更有效、安全、通用且易于本地化生产,使人类对自然或人为制造的流行病产生抵抗力。人类进化于全球人口仅 800 万且主要户外活动的环境,因此直觉上应该能轻松适应如今更高威胁的世界。

这些方法叠加使用可将空气传播疾病的 R0 值降低 10-20 倍(例如:改善空气质量使传播率降低 4 倍,感染者立即知晓需隔离使传播率降低 3 倍,即使简单上调呼吸系统免疫力也能使传播率降低 1.5 倍),甚至可能更多。这将足以阻止所有现存空气传播疾病(包括麻疹)的扩散,而这些数字还远未达到理论最优值。

随着实时病毒测序技术的广泛应用以实现早期 检测,”悄无声息传播的生物武器”这一概念 能够在不触发警报的情况下感染全球人口的说法变得非常可疑。值得注意的是,这种技术甚至能捕捉到更高级的手段,比如同时释放多种流行病和只有在组合使用时才会产生危险的化学物质。

现在, 让我们记住,我们正在讨论的是 AI 2027 情景——其中纳米机器人和戴森群被列为 2030 年前的”新兴技术”。这种技术突破带来的效率提升,也让我们有理由对上述应对措施的广泛部署保持乐观,尽管在 2025 年的今天,人类依然行动迟缓、效率低下,大量政府服务仍停留在纸笔办公阶段(且毫无合理的安全依据)。 如果全球最强 AI 能在 2030 年前将森林田野改造成工厂和太阳能农场,那么全球第二强的 AI 也完全能在 2030 年前为我们的建筑安装大量传感器、照明设备和过滤系统 

但让我们进一步延伸 AI 2027 的假设,进入完全的科幻领域:

  • 人体内部(鼻腔、口腔、肺部)的微观空气过滤系统
  • 从发现新病原体到立即调整免疫系统的即时自动化应对管道
  • 如果”意识上传”技术可行,那就干脆把整个身体换成特斯拉 Optimus 或者宇树科技 (同时实时将数据流备份到位于火星的 K-Scale 开源人形机器人上——采用不同品牌实现冗余备份)
  • 各种新型制造技术——作为机器人经济的一部分很可能会被超级优化——将能在本地生产出比现在多得多的这类产品,完全不需要全球供应链

在一个癌症和衰老已于 2029 年 1 月被攻克的世界里,此后进展更是突飞猛进,而当我们身处 2030 年年中时,竟然还没有能实时生物打印并将物质注入体内以抵御任意感染(甚至毒素)的可穿戴设备,这实在显得难以置信 。前述生物学论点并未涵盖镜像生命和蚊子大小的杀人无人机(根据 AI 2027 场景预测,这类技术将于 2029 年开始投入使用)。不过,这些手段都无法实现 AI 2027 场景所描绘的那种突然的完胜,而且如何对称防御它们显然要直观得多。

因此, 生物武器实际上不太可能像《AI 2027》场景描述的那样彻底消灭人类 。当然,我所描述的一切结果也远非人类的完胜。无论我们采取什么措施(或许除了”将意识上传至机器人”这个选项),一场全面的人工智能生物战争仍然极其危险。但达到远低于人类完胜的标准仍有价值: 攻击行动即使部分失败的高概率,也将形成强大的威慑力 ,足以阻止已在世界上占据强势地位的人工智能尝试发动任何形式的攻击。而且,人工智能发展的时间线越长,这种防御方式就越有可能更充分地兑现其承诺。

如果将生物攻击与其他攻击方式结合会怎样?

上述各类应对措施的成功——尤其是那些需要集体行动才能拯救超过少数爱好者群体的方案——取决于三个前提条件:

  1. 全球的实体安全 (包括生物防护和反无人机系统)由地方化权威 (无论人类还是 AI)掌控,且这些权威不全是”共识-1″的傀儡(”共识-1″是指在 AI 2027 场景中最终控制世界并灭绝人类的 AI 名称)
  2. 共识-1 无法攻破所有其他国家(或城市及其他安全区域)的防御系统并立即将其清零
  3. 共识-1 不掌控全球信息圈 以至于没人愿意费心去尝试自我保护

直觉上,(1)存在两种可能。如今有些警力高度集中化,拥有强大的国家指挥体系,而另一些则保持地方化。如果实体安全必须快速转型以适应 AI 时代需求,那么整个格局将彻底重置,最终结果取决于未来几年做出的选择。政府可能懈怠地全部依赖 Palantir 系统,也可能主动选择结合本地开发与开源技术的方案。这里我认为,我们只需要做出正确选择。

关于这些议题的许多悲观论述都假定(2)和(3)已无药可救。让我们更详细地逐一审视。

网络安全末日论也远非板上钉钉

无论是公众还是专业人士都普遍认为,真正的网络安全已无望实现,我们最多只能在漏洞被发现时快速修补,并通过囤积自身发现的漏洞来维持对网络攻击者的威慑力 。或许我们能做到的最好情况就是《 太空堡垒卡拉狄加 》中的场景——几乎所有人类飞船同时因赛昂网络攻击而瘫痪,仅存的幸存飞船之所以安全,是因为它们完全未使用任何联网技术。我并不同意这种观点。 相反,我认为网络安全的”终局”将极度有利于防御方,凭借《AI 2027》所假设的快速技术发展,我们完全能够实现这一目标 

理解这一点可以采用 AI 研究者最钟爱的方法:趋势外推。根据 GPT 深度研究对每千行代码漏洞率随时间变化的调查数据(假设采用顶级安全技术),我们可以绘制出这样的趋势线。

除此之外,我们也见证了沙箱隔离技术及其他可信代码库最小化技术在开发层面和大众消费应用层面的显著进步。短期内,仅攻击者掌握的超智能漏洞挖掘工具仍能发现大量漏洞。但若能公开获取高智能的漏洞检测代理或形式化验证工具,最终的自然平衡状态将是:软件开发者在持续集成流程中就能发现所有漏洞,而后才发布代码。

我能预见两个强有力的理由,说明即使在这个世界,漏洞也远不会被彻底消除:

  • 因人类意图本身极其复杂而产生的缺陷 ,因此主要困难在于构建足够准确的人类意图模型,而非代码本身。
  • 非安全关键组件 ,我们可能会延续消费科技领域已有的趋势——倾向于通过编写更多代码来处理更多任务(或降低开发预算)来消耗软件工程的进步成果,而非在不断提高的安全标准下完成相同数量的任务。

但这两类情况都不适用于”攻击者能否获取维系我们生命的系统根权限?”这类场景,而这正是我们在此讨论的核心问题。

我承认自己的观点比当前网络安全领域众多智者所持的主流看法更为乐观。但即便你在当下语境中不认同我的观点,也值得记住:AI 2027 情境假设的是超级智能的存在。至少,如果”1 亿个以 2400 倍人类速度思考的超级智能体”都无法让我们获得没有此类缺陷的代码,那么我们就该彻底重新评估”超级智能拥有作者所设想的那种强大能力”这个设想了。

我们终将需要大幅提升安全标准——这不仅针对软件,同样适用于硬件 IRIS 项目就是当前提升硬件可验证性的一次尝试。我们可以将 IRIS 这类方案作为起点,或开发更先进的技术。实际上,这很可能需要采用”构造即正确”的方法——即关键部件的硬件制造流程在设计之初就预先考虑特定的验证程序。而 AI 驱动的自动化将使所有这些工作变得容易得多。

超级说服力末日论也远非板上钉钉

正如前文所述,防御能力大幅提升可能无关紧要的另一种情况是:人工智能直接说服了临界数量的群体,让他们相信无需防范超级智能的威胁,并认定任何试图为自己或社群寻求防御方案的人都是罪犯。

我长期以来的总体观点是,有两件事可以提升我们抵御超级说服的能力:

  • 去中心化的信息生态系统 。可以说我们正逐渐步入后推特时代,互联网正日趋碎片化 。这种趋势是良性的(即便碎片化过程充满混乱),我们总体上需要更多元的信息格局。
  • 防御性人工智能 。个人需要配备本地运行的专属 AI,这些 AI 必须明确效忠于用户本人,以对抗网络上的黑暗模式和威胁。目前已有这类理念的零星试点(例如台湾的讯息检查官应用可在手机端进行本地扫描),也存在进一步测试这些构想的天然场景(如反诈骗保护),但这个领域还需要更多投入。

右图从上至下:网址检测、加密货币地址检测、谣言检测。此类应用可以变得高度个性化、用户自主且功能强大。

这场较量不应是”极度超级智能”的超强说服者对抗个人,而应是”极度超级智能”说服者对抗加上一个为你效力的、稍逊一筹的智能分析师的组合。

本该是理想状态。但现实会如此发展吗? 全面普及信息防御技术是个极难实现的 目标,尤其在”AI 2027″设想如此紧迫的时间框架内 但可以说,更温和的里程碑就足够了。如果 集体决策才是最重要的,并且正如 AI 2027 情景所暗示的,所有重要事件都发生在单一 选举周期内,那么严格来说关键在于 直接决策者 (政客、公务员以及部分企业中的程序员等角色)需要配备优质的信息防御技术。这在短期内相对更易实现——根据我的观察,这类人群已普遍习惯通过多个人工智能辅助决策。

这些论点带来的启示

在”AI 2027″的设定中,超级智能 AI 能轻易消灭人类被视为既定事实,因此唯一能做的就是确保主导 AI 保持善意。而在我的认知框架中,实际情况复杂得多——主导 AI 是否具备轻松消灭人类(及其他 AI)的能力,这个关键变量本身尚存争议,且我们可以通过行动来调节其参数。

若这些论证成立,其对当前政策的启示与”主流 AI 安全教条”时同异:时而观点相近,时而大相径庭。

  • 延缓超级智能 AI 的发展仍是明智之举 。超级智能 AI 若在 10 年后而非 3 年内出现风险更低,若能延迟到 30 年后则更为稳妥。给予人类文明更多准备时间总是有益的。

    如何做到这一点是一个 颇具挑战性的问题。我认为提案中提到的10 美国州级人工智能监管的年度禁令被否决 ,但特别是在 SB-1047 等早期提案失败后, 从这里开始,前路变得不那么明朗。在我看来,最不 最强势且最有效减缓高风险人工智能发展的方式 很可能需要某种形式的条约来规范最先进的 硬件设备。许多实现有效防御所需的硬件网络安全技术 同时也是可用于验证的关键技术 国际硬件条约的存在甚至能带来协同效应。

    不过值得注意的是,我认为主要风险来源 是与军方相关的行为体,他们将极力争取 不受此类条约约束;这种情况绝不能被允许,如果 若最终演变成这样,那么纯军事化 AI 的发展可能 加剧风险。

  • 对齐工作——即让 AI 更倾向于行善而非作恶——依然具有积极意义 。主要例外情况始终是:当对齐工作最终演变为提升 AI 能力时(例如可参阅关于评估影响的批判性观点 
  • 加强 AI 实验室透明度的监管措施仍具价值 。促使 AI 实验室规范运作始终是 这将降低风险,而透明度是实现这一目标的有效方式之一。
  • “开源有害”的思维模式会带来更大风险 。许多人反对开源权重人工智能,理由是防御不切实际,唯一乐观的路径是:拥有良好对齐 AI 的正义方,能在其他意图不良者获得任何危险能力之前,率先达到超级智能水平。但本文的论述展现了不同图景: 恰恰在某个参与者遥遥领先、而其他方完全无法企及的情况下,防御才真正变得不切实际 。通过技术扩散维持力量平衡变得至关重要。但与此同时,我绝不认为仅仅 因为采用开源方式
  • 美国实验室中 “必须竞速击败中国” 的思维模式会因类似原因变得更加危险 。如果霸权地位不能成为安全缓冲, 而是一种风险来源,那么这就是反对的又一论据 (不幸的是太常见了)认为一个善意的人应该加入 领先的人工智能实验室助其加速制胜。
  • 诸如公共人工智能这类倡议愈发显得明智 ,既能保障广泛 人工智能能力的分布,并确保基础设施相关方 真正掌握快速运用新 AI 能力的工具, 以落实本文所要求的某些应用方式。
  • 防御技术应更偏向”为羊群披甲”,而非”猎杀所有恶狼”。关于脆弱世界假说的讨论常假定唯一解决方案是霸权维持全面监控以防范潜在威胁。但在非霸权主义世界中,这种方案并不可行(参见: 安全困境 ),事实上自上而下的防御机制极易被强大 AI 颠覆并转化为其攻击手段。因此,更大比重的防御工作必须通过夯实世界基础韧性来实现。

上述论点纯属推测,切勿将其视为近乎确定的事实而采取行动。但《AI 2027》的故事同样具有推测性,我们也不应假定其具体细节近乎必然,并据此采取行动。

我特别担忧这样一种普遍假设:打造一个 AI 霸主并确保其”对齐”且”赢得竞赛”,是唯一的出路。在我看来,这种策略存在相当高的风险,它恰恰会削弱我们的安全性——因为一旦霸主失控,我们将丧失制衡能力。如果政治压力(这极有可能发生)导致该霸主与军事应用深度绑定(参见 [1][2][3][4]),许多对齐策略将更难奏效,这种风险就尤为突出。

在 AI 2027 的设想中,成功的关键在于美国选择安全之路而非毁灭之路——通过在关键时刻主动放缓人工智能发展步伐,以确保 Agent-5 的内部思维过程能被人类解读。即便如此,成功也非必然,人类如何从依赖单个超级智能持续对齐才能维持生存的边缘退后,目前仍不明确。承认世界确实可以变得不那么脆弱,并投入更多努力运用人类最新技术来实现这一目标,是条值得尝试的路径——无论未来 5-10 年人工智能如何发展。

了解 RecodeX-立足新加坡,洞察全球 AI 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读