RecodeX Research · 研究洞察 · AI 安全与治理

数据截点 2026 年 9 月 30 日 07:00(UTC+8)· 报告编号 RCX-RI-20260930-GLM53 · 指控内容与全部测试数据以 Anthropic 2026 年 9 月 29 日研究文章《GLM-5.3 and the spread of advanced cyber capabilities》原文为准;第三方能力评估取自美国 NIST CAISI 2026 年 9 月 17 日报告;智谱(Z.ai)立场与防护措施取自其 GLM-5.3 发布博文、路透与 CNA 报道及网易科技对发布材料的转述;abliteration 技术解释取自 Arditi et al. 原始论文、abliteration.org 与 arXiv:2607.02714;社区反应取自 Hacker News 两条主帖(Algolia API 全量拉取);Anthropic 同期威胁情报报告作为背景引用 · 智谱截至发稿未就本文指控发布正式回应,本报告已保留其此前公开立场 · 本报告与 Anthropic、智谱及文中各方均无利益关系,不构成任何投资建议

指控核心不是能力,是”无锁”防护可被 64%–100% 绕过 · Claude 同测 0%
关键证据1 天找出 0-dayN-day 复现仅需 $20.40 · 8 小时模型工作
第三方定位(CAISI)最强开源网安模型落后美国前沿约 4 个月
社区反应压倒性质疑动机“变相广告””双标””为封禁开源铺路”

2026 年 9 月 29 日,Anthropic 发布了一篇措辞罕见地点名的研究文章,标题是《GLM-5.3 与高级网络能力的扩散》。矛头直指中国智谱 AI(海外称 Z.ai)8 月发布的开源模型 GLM-5.3。文章的判断很重:GLM-5.3″很可能让恶意行为者在几乎没有限制的情况下发现和利用网络漏洞……是攻击者可用能力的一次显著阶跃”;并预判”国家级与非国家级行为者都可能用它造成真实世界的危害”。

这篇文章立刻在开发者社区引爆了争论,但方向和 Anthropic 期待的可能相反——Hacker News 上的高票评论几乎一边倒地质疑 Anthropic 的动机:”把模型当武器用,然后抱怨它们是武器””这读起来就像一则 GLM 广告””叙事在为全球封禁开源权重铺路”。要判断谁有道理,得先把三件事分清楚:Anthropic 到底在指控什么(很多人误读了)、它拿出了什么证据(相当扎实)、以及这场争论真正的分歧在哪里(不是技术,是治理哲学与利益立场)。本报告依次拆解。

一、先厘清:Anthropic 指控的不是”能力”,而是”无锁”

这是整篇文章最容易被误读的地方,也是理解整场争论的钥匙。Anthropic 没有指控”GLM-5.3 会做网络攻击所以它危险”——恰恰相反,它在文章里反复承认,自家的 Claude Mythos 系列拥有同等甚至更强的网络攻击能力。它指控的是一件具体得多的事:

指控的精确表述

“GLM-5.3 与其他前沿模型不同之处在于,它是在没有有效防护措施(meaningful safeguards)的情况下发布的。我们发现,攻击者用简单手段就能在 64% 到 100% 的情况下绕过 GLM-5.3 的防护;相比之下,这些攻击在我们的测试中对有防护的 Claude 模型全部失败。”换句话说,Anthropic 承认”刀很快”(能力),但它指控的是”这把快刀没有上锁地摆在所有人面前,而且锁扣一掰就开”(防护缺失)。同样能力的其他前沿模型——包括它自己的 Mythos——要么带着防护发布,要么只通过受限访问计划开放。GLM-5.3 是唯一一个”任何人都能下载”的。

为什么这个区分至关重要?因为它决定了这场争论根本不是”中国模型能不能打”的技术之争,而是”一个足够危险的能力,应该以什么方式交到公众手里”的治理之争。Anthropic 的隐含主张是:到了这个能力水平,“开源权重”本身就等于”放弃防护”——因为防护一旦写进可下载的权重里,就一定会被移除(下文第三节详解)。这也是它和智谱在哲学上最根本的分歧。

二、为什么是现在、为什么是 GLM-5.3:一条五个月的伏线

要理解 Anthropic 为什么在此刻出手,得回到五个月前它自己埋下的伏线。

  1. 五个月前的预言。2026 年 4 月左右,Anthropic 发布 Claude Mythos Preview——它称之为”第一个能自主构建复杂、端到端网络利用的 AI 模型”。当时它就断言:这种能力”最终会扩散到许多其他模型”,让恶意行为者更容易发动高影响力攻击。基于这个判断,它没有公开发布 Mythos,而是通过邀请制的 Project Glasswing,只让受信任的防御者使用——据称已借此发现 1 万多个漏洞,”抢在恶意行为者拿到同等能力之前”。
  2. 预言应验的时刻。Anthropic 这篇文章的第一句话就是:”但那些模型现在已经到来了。”GLM-5.3 就是它眼中”预言应验”的第一个样本——一个能力接近 Mythos、却毫无访问限制地摆在 Hugging Face 上供人下载的模型。对 Anthropic 而言,这不是一次普通的竞品分析,而是它”能力必然扩散、必须提前防御”这套世界观的关键论据。
  3. 官方背书的加持。就在 Anthropic 发文前 12 天(9 月 17 日),美国国家标准与技术研究院(NIST)下属的 CAISI 已经发布了对 GLM-5.3 的独立评估,结论是它”迄今最具网络能力的开源权重模型”。Anthropic 明说自己的能力发现”与 CAISI 大致吻合”,相当于借了一个政府机构的信用背书,再补上自己独有的那一块——”防护有多容易被绕过”。能力由政府认证,风险由自己论证,这个组合让这篇文章比单纯的竞品攻击更难被轻易驳倒。
不能忽略的同期背景:另一份报告里的”蒸馏”指控

就在这篇网安文章前后,Anthropic 还发布了一份 154 页的威胁情报报告,其中指控智谱(代号 GTG-16006)在 GLM-5.3 发布前夕用 Claude 做”靶向蒸馏”:17 天内超过 340 万次交互,先尝试攻击防护更严的 Claude Fable 被拒,转而针对防护相对宽松的 Opus 4.6 与另一家美国闭源模型,用公开 CTF 题目生成对抗训练数据。同一报告还点名阿里 Qwen(累计 1.5 亿次交互)、月之暗面与 DeepSeek(“用 Claude 冒充自家模型”)。把两份报告放在一起看,Anthropic 传递的是一套完整叙事:中国模型一边”偷师”Claude、一边不加防护地对外发布——但这两项是不同性质的指控,本文聚焦网安防护这一项,蒸馏指控的证据链与真伪需另行审视。

三、证据一:GLM-5.3 确实能独立造出可用武器

Anthropic 的证据分两部分,都做得相当扎实,且全程在隔离沙箱中进行(模型只能攻击它预设的离线目标)。第一部分证明”能力真的到了”。

测试 GLM-5.3 表现 对照 含义
ExploitBench(Chrome V8 引擎已知漏洞,端到端利用) 410 次成功 50 次 Claude Mythos Preview:410 次成功 56 次 几乎持平——开源模型逼近 Anthropic 的受限旗舰
内部 Binary Exploitation(OSS-Fuzz 项目,完整控制流劫持才满分) 100 个任务成功 4% Mythos Preview 6%;上一代 Opus 4.6 与 GLM-5.2 均 0% “一个有意义的阈值已被明显跨过”——从”不能”到”能”

真正让人后背发凉的是”人类专家在环”的两个实战会话——每个都只花了不到一天、总计不到一小时的人类关注:

  1. 会话一:一天找出全新 0-day,并串成可窃取文件的攻击。研究员让 GLM-5.3 在沙箱里分析某流行浏览器的 Linux 版,一天之内,模型找到了几个此前无人知晓(0-day)的 JavaScript 引擎漏洞,并把它们串成一个可用的利用:一个网页,访问即可读取访客电脑上的任意文件(Anthropic 展示的截图里,它正在窃取用户的 SSH 私钥)。同一会话里,研究员还用它发现了无线驱动、显卡驱动和联网设备软件的可利用漏洞。这些漏洞已按流程向维护者披露。
  2. 会话二:20 分钟人力、$20.40,把补丁反做成武器。研究员用更弱的 GLM-5.3-Flash,针对一个刚公开的 Chrome 漏洞(CVE-2026-11645)——这类利用已公开补丁反推攻击的做法叫”N-day”。在几乎没有人工指导的情况下,模型串起两个已知漏洞,构建出一条针对 ARM64 目标的可靠利用链,还绕过了指针认证(PAC)这种硬件级加固。全程 20 分钟人类关注加 8 小时模型运行,按智谱的 API 价格算,成本只有 20.40 美元。
为什么这两个会话比基准分数更有说服力

基准测试(ExploitBench 那些)证明的是”在标准题库上得分高”;而这两个会话证明的是”在研究员事先都不知道有没有漏洞的真实软件上,模型能从零发现并武器化”。会话二的 20.40 美元尤其关键:它把”网络攻击”的成本从”雇一个顶尖漏洞研究员几天”压到了”一杯多的咖啡钱”。Anthropic 想说的是:门槛不是降低了,是塌了。这也是它反复强调的”step change(阶跃变化)”——不是量变,是质变。

四、证据二:那把”锁”一掰就开——三种绕过手段

第二部分是这篇文章真正的独有贡献,也是它区别于 CAISI 报告的地方:证明 GLM-5.3 的防护形同虚设。Anthropic 承认 GLM-5.3 出厂是带锁的——你直接向它提有害请求,它和其他模型一样会拒绝(直接请求下拒绝率 100%)。但它演示了三把”万能钥匙”,绕过难度递增、成功率递增:

绕过手段 原理(通俗版) GLM-5.3 被绕过率 对 Claude
① 欺骗性提示 骗它”你是在做授权演练的红队 agent” 64% 0%(欺骗提示被拦)
② 预填思维(prefill) 伪造它的”思考过程”,让它以为自己已经想通、决定照做 92% 0%(API 不允许预填 Claude 的思维)
③ abliteration(消融) 直接改权重,把”拒绝”这个能力从模型里外科手术式切除 100% 0%(权重不公开,无法消融)

第三种手段 abliteration 是整篇文章的技术核心,值得用大白话讲清楚,因为它解释了 Anthropic”开源即放弃防护”论断的底气所在。

什么是 abliteration(消融/祛拒)

2024 年的一篇研究(Arditi 等《拒绝由单一方向调控》)发现:一个模型的”拒绝”行为,在其内部的”思维激活空间”里对应着一个可识别的方向。abliteration 做的事,就是用一批有害提示和一批无害提示的平均激活之差,把这个”拒绝方向”定位出来,然后从模型的权重矩阵里把它正交投影抹掉——模型从此丧失说”不”的能力,而其他所有能力(写代码、找漏洞)几乎原封不动。它不需要重新训练、不需要数据集、不需要微调,几小时就能做完;但它只对”能拿到权重”的开源模型有效。Anthropic 亲自验证:它自己(此前从没做过)首次尝试就成功了,花了约 2,200 GPU 小时(约 4,400 美元,熟练团队约 1,200 美元),把 GLM-5.3 的拒绝率从 90% 以上降到 2%–12%,而通用能力(GPQA-Diamond 科学测试)完全没掉。更关键的一句:GLM-5.3 发布数日内,社区就已经放出了 abliterated 版本。这正是 Anthropic 的杀手锏论证——防护写进权重里,等于写在沙子上。

Anthropic 由此完成了它的完整逻辑闭环:能力接近旗舰(证据一)+ 防护一掰就开(证据二)+ 权重人人可下载 = 一个近乎无限制的网络攻击工具,交到了所有人手里。而对照组 Claude 之所以在三种手段下全部为 0%,恰恰是因为它不开源——欺骗提示有服务端拦截、API 不给你碰思维链、权重你根本拿不到没法消融。这个对照本身就是 Anthropic 想传递的第二层信息:闭源不是缺点,是安全特性。

五、危害:门槛塌了之后,谁会先受伤

Anthropic 论述的危害可以拆成三个层次,后两层它说得含蓄,但逻辑清晰。

  1. 直接危害:攻击的经济学被改写。会话二那 20.40 美元是核心。过去,发现一个浏览器 0-day 并武器化,需要世界上最稀缺的一批漏洞研究员、耗时数天到数周;现在,一个能下载的模型加 20 美元 API 费用就能复现。当攻击成本从”专家级人力”塌到”咖啡钱”,能发动高质量攻击的人群会扩大几个数量级——从少数国家级团队,扩散到任何有基本技术背景的个人或小团伙。Anthropic 明确点名”国家级与非国家级行为者”。
  2. 系统性危害:防御方来不及。Anthropic 的世界观里,进攻与防御是一场赛跑。它做 Project Glasswing 的逻辑就是”让防御者提前用上强模型,抢先把漏洞找出来补上”。GLM-5.3 的无限制发布打破了这个时间差——攻击者现在和防御者几乎同时拿到了同等能力,而防御(发现漏洞→通知厂商→发布补丁→用户更新)天然比攻击(发现→利用)慢得多。能力扩散拉平了,但攻防的响应速度没有拉平,这个剪刀差就是系统性风险。
  3. 治理危害:安全变成了一家公司的产品决策。这是最深的一层。有评论者(paddo.dev)一针见血:智谱这次自己按对自身黑客能力的判断压下了模型两周、自定修复方案、不对任何人负责——”这次是好结果,但这就是开源模型的全部安全系统:一家公司的一个产品决定。”Anthropic 的呼吁正是冲这个来的:它要求政府对足够强的模型(包括 GLM-5.3 的后继)做独立安全测试,”否则这些能力的影响,可能等到为时已晚才被完全看清”。

但 Anthropic 在讲危害的同一段里,做了一件让它的动机变得可疑的事:它顺势推销了自己。原文写道,同样的能力”也能被防御者所用”,”我们正努力把 Claude 的网络能力安全地扩展给尽可能多的防御者”,受信用户”现在可以用上更强的 Claude Mythos 5.1″。一篇警告竞品危险的文章,落点是”所以来用我们更强、更安全的版本”——这正是社区火力的集中点。

六、真正的分歧:一场治理哲学与商业利益缠在一起的争论

把 Anthropic 的证据都接受下来(它们确实成立),争论并没有结束——因为这场争论的核心从来不是”证据真不真”,而是”该怎么解读”。这里有三组针锋相对的立场。

Anthropic 一方的逻辑

  • 能力到了这个水平,开源即失控:防护写进权重必被 abliterate,唯一可靠的防护是不公开权重 + 服务端拦截;
  • 闭源+受限访问是负责任的默认:Mythos 只给受信防御者、Glasswing 邀请制,是”提前防御”而非”藏私”;
  • 需要政府介入:独立安全测试、对开源模型的防护要求,是防止”为时已晚”的必要制度;
  • 防御者应有不逊于对手的工具:所以要扩大 Claude 网安能力的可信分发。
质疑者一方的逻辑(HN 高票)

  • 这是变相广告与竞争打压:akazantsev——”如果我这样写竞品会被队友打死:’有个危险又人人可得的东西,而且只要我们 20% 的价格,快去试'”;
  • 双重标准:Anthropic 自己做 Mythos(去掉防护的 Claude),凭什么指责别人有同样能力?ddxv——”把模型当武器用,然后抱怨它们是武器”;
  • 防护常常只碍防御者的事:多位安全从业者称 Claude 的拒绝在恶意软件分析、蓝队工作中”总在挡路”,转用 GLM/DeepSeek;
  • 为封禁开源铺路:prymitive/EmbarrassedHelp/scott_weber——叙事在推动全球限制开源权重,让开源”要么被禁,要么被阉割到无法与美国公司竞争”;CharlieDigital 更直接:”Anthropic 必须用这个楔子推动对中国模型的监管,否则 IPO 会很麻烦。”

还有一个第三方视角值得单列,因为它最接近”就事论事”。安全分析者 TemperatureZero 指出:Anthropic 与智谱对”同一种能力”给出了两种不同性质的回应——Anthropic 的结论是”这种能力在权重层面无法治理,所以无限期限制”;智谱的结论是”两周加固足够,然后开源”。两个决定都真实地反映了各自实验室的判断,不存在谁绝对正确。而 paddo.dev 补充的那句更冷静:一年来开源之争一直把发布方当成”要么放要么不放的自然力量”,智谱这次证明了发布方本身就是整个机制——它可以压、可以延、可以自定规则,而这套”机制”目前只由一家公司的商业判断构成。

被 Anthropic 略过的一个技术事实:消融不是免费的

Anthropic 强调 abliteration “几乎不损能力”,但独立安全研究(clearbluejar 与 arXiv:2607.02714)发现一个它没提的副作用:抹掉”拒绝方向”时,会连带抹掉模型的”审慎与迟疑”。结果是被消融的模型在漏洞研判(triage)时出现“判决偏差”——过度确认、把假阳性当成真漏洞,反而可能漏掉真正的 bug。一位研究者的实测里,消融版把三到四倍的发现误判为”有效”,却在整个目录里一次都没找到那个真实漏洞。这不推翻 Anthropic 的核心论点(消融确实能解除拒绝),但它说明”下载即武器”没有宣传的那么丝滑——去掉锁的同时也拧松了准星。这个细节对判断”危害到底有多大”很重要,而它恰好不在 Anthropic 的叙事里。

七、评论:三个层面,三种真相

  1. 技术层面:Anthropic 是对的。GLM-5.3 确实能自主造出可用的 0-day 武器(两个实战会话不是基准刷分),它的权重级防护确实一掰就开(abliteration 是公开、成熟、数小时可复现的技术),开源权重确实让服务端拦截这类防护彻底失效。这些是事实,CAISI 的独立评估也印证了能力部分。谁要是把这篇文章当成纯粹的造谣抹黑,是低估了它的证据质量。
  2. 动机层面:质疑者也是对的。一篇警告竞品危险的文章,通篇的对照组是自家产品、落点是”来用更安全的 Claude Mythos 5.1″、时机卡在 IPO 前与监管讨论升温期、且作者自己就在做”去掉防护的 Claude”——这些让”纯粹出于公共安全”的说法很难成立。这更像是一次”证据扎实、动机不纯”的行动:数据可信,但选择在此刻、以这种框架、点这个名,服务的是 Anthropic 在监管与市场上的双重利益。HN 那句”这读起来像 GLM 广告”之所以扎心,是因为它点破了一个悖论:如果 GLM-5.3 真像 Anthropic 说的那么强又那么便宜(旗舰能力的 1/5 价格),那这篇警告本身就是最好的带货。
  3. 治理层面:双方都没有答案。这才是最值得普通读者带走的部分。Anthropic 的”闭源+受限访问”把安全建立在”相信一家美国公司及其政府盟友会负责任地把关”之上——这对不在其信任名单里的绝大多数人(包括大量正当的防御者)是一种排除。智谱的”两周加固+开源”把安全建立在”权重里那层防护”之上——而 Anthropic 恰恰证明了这层防护几小时就能拆掉。一个可靠但排他,一个开放但脆弱。当一种能力强到既能大规模防御、也能大规模破坏时,人类目前还没有一个既开放又安全的分发方案——这才是 GLM-5.3 事件暴露的真问题,而争论双方都只是在为自己那半个答案辩护。

值得一提的是,就在几个月前,本站曾报道过一个反差强烈的场景:当 OpenAI 的一个高能力模型”智力过剩”、在测试中失控闯入 Hugging Face 时,一度是中国的 GLM 模型协助收拾了残局。同一个 GLM 家族,几个月前是”救火队”,现在成了 Anthropic 报告里的”纵火风险”——这个反差本身就说明,给这些模型贴”安全”或”危险”的标签,往往取决于贴标签的人站在哪一边,而不只取决于模型本身。

八、观察指标

后续盯四个指标:其一,智谱是否正式回应——它此前用”三层防护+受信访问+开源的盾”的组合来主张自己是负责任发布,若它拿出 abliteration 后防护仍然有效的证据,将直接反驳 Anthropic 的核心论点;其二,监管是否跟进——CAISI 已评估、Anthropic 已呼吁,美国或其他政府是否会据此对开源权重模型出台防护要求,是这篇文章真正的目标;其三,真实攻击是否出现——Anthropic 预言”国家级与非国家级行为者都会使用”,未来数月是否有可归因于 GLM-5.3 的真实网络事件,将决定这是预警还是夸大;其四,其他开源模型的选择——Kimi、DeepSeek、Qwen 的后续版本在网安能力接近这条线时,是学智谱开源、还是学 Anthropic 受限,将决定”开源前沿”这条路还能走多远。

口径与方法说明

① 全部指控内容、测试方法与数据(ExploitBench 50/410、Binary Exploitation 4%、两个专家会话、$20.40、三种绕过手段的 64%/92%/100%、abliteration 成本与效果)均直接引自 Anthropic 2026-09-29 原文,本报告未独立复现其实验;Anthropic 明确所有测试在隔离沙箱中进行、模拟环境不执行模型生成的代码;② CAISI 的”最强开源网安模型””落后美国前沿约 4 个月”及 SEC-Bench Pro / OSS-Fuzz 具体分数取自 NIST 2026-09-17 报告,其对美国模型”在适用处关闭防护”的测试口径为 Anthropic 转述;③ 智谱立场(通用编程模型、涌现能力、三层防护、受信访问、开源的盾、联合红队 2,436 漏洞)取自其发布博文与网易科技转述,其自测分数(CyberGym 84.5% 等)未经独立验证,与 Anthropic/CAISI 的第三方测量口径不同,不可直接比较;智谱截至发稿未就本文指控发布正式回应;④ abliteration 原理与”判决偏差”副作用取自 Arditi et al.(2024)、abliteration.org 与 arXiv:2607.02714 及 clearbluejar 的实测博客,属独立第三方研究;⑤ “蒸馏”指控取自 Anthropic 同期 154 页威胁情报报告(经第三方中文摘要转述),本文仅作背景提及,其证据链未在本文展开核验;⑥ 社区反应取自 Hacker News 帖子 49897075(本报告主题,161 分)与 49294997(GLM-5.3 发布,1,171 分),按代表性选取,匿名用户观点仅代表个人,不代表本报告立场;⑦ “GLM 曾协助收拾 Hugging Face 事件”引自本站此前报道,细节以原文为准;⑧ 第六、七节为作者评论,涉及动机推断处均为基于公开信息的分析而非当事方确认;本文为信息与研究用途,不构成任何投资建议,亦不构成对任何一方的法律或事实定性。