返回首页
信息来源:stratechery.com 2026.07.21 18:25 约 17 分钟 中国 AI 力量 1.2万 阅读

谁会惧怕中国的人工智能模型?

我有个关于自己在凯洛格管理学院 STRT-431 课程第一天经历的故事。这门课是所有一年级 MBA 学生都必须修读的入门课程,我翻阅了其中的阅读材料与案例研究后,却发现其中没有涉及任何科技公司,这让我颇为失望。出于我的性格,课后我便去询问教授原因,得到的答复是:这门课程的目的并非非要让学生了解特定行业,而是要帮助他们发现那些可广泛应用的通用原则,这些原则能够运用到任何行业的任何公司中。

正如我常说的那样,我并不认为这个结论令人十分满意:在我看来,技术的本质——尤其是软件与内容分发具有零边际成本(以及零交易成本)这一特点——其实有着根本的不同;在公式中填入零值往往会带来严重的后果!不过我很快意识到,这恰恰是我的机会。聚合理论背后的核心观点是,零边际成本会造就与人们曾经基于互联网所预期的截然不同的价值链:在一个控制需求比分配供给更为重要的世界里,会出现集中化与规模化的趋势。

然而,人工智能最引人注目的地方在于那些古老的普遍原则正在以前所未有的程度重新回到人们视野之中。上周末的种种争论便是明证——在 X 平台上,人们就另一款来自中国的开源模型 Kimi K3 所展现出的强大性能及其可能带来的影响展开了激烈讨论。简而言之,无论是从免费顶尖模型的短期影响,还是从该行业的长期发展格局来看,边际成本都再次成为了关键因素。

成本与研发支出

在关于开放权重模型的讨论中,最普遍的误解之一就是认为这类模型更便宜——甚至是免费的。毕竟,人们只需下载相应的权重文件,便可省去开发自有模型所需的时间、成本与精力。当然,这确实没错,但这里的“免费”实际上指的是研发方面所需的投入;研发费用是一笔固定支出,与所产生的收入无关。无论你创造了 10 万美元还是 1 亿美元的收入,只要在研发上投入了 100 万美元,这一成本就依然存在(当然,这会影响企业的盈利能力)。

与收入相关的是销售成本——即商品销售成本,而对人工智能而言,这种销售成本的存在时间已经远远长于软件行业。具体来说,无论使用的是 Kimi 还是 Fable 这样的模型,进行推理运算都需要花费资金,而在大多数商业模式中,人工智能服务提供商在推理上的投入与收入之间存在直接关联。以之前的例子来说明,要产生 1 亿美元而非 10 万美元的收入,其所需的销售成本很可能高达前者的 1000 倍。换算成具体数字,如果生成能够带来 1 美元收入的代币需要 50 美分成本,那么 1 亿美元的收入对应的销售成本将为 5000 万美元;而 10 万美元的收入对应的销售成本则仅为 50 万美元。

关于开放权重模型需要指出的是,使用它们并非免费。Kimi K3 的输入代币成本为每百万个 3 美元,输出代币成本为每百万个 15 美元;这一价格虽然低于 Sol 每百万输入代币 5 美元、每百万输出代币 30 美元的费用,但或许这甚至都不是恰当的衡量标准。

代币与智能

英伟达首席执行官黄仁勋将英伟达正在开发的成果称为“代币工厂”,从英伟达的角度来看,这种表述确实很有道理。英伟达的 GPU 并不局限于特定模型:它们能够以最快、最高效的方式生成代币。因此人们会用每秒生成代币数、生成第一个代币所需时间、每瓦特生成的代币数以及代币成本等指标来衡量其性能,而黄仁勋认为这些指标将成为决策的重要依据。

在人工智能的第一个发展阶段,也就是 ChatGPT 时代,由于代币是直接传递给最终用户的,这种衡量方式确实很有意义。然而在人工智能的第二个发展阶段,也就是推理时代,这种衡量标准就不再适用了。因为进行推理需要大量の思维链代币,而且不同的模型为了得出正确答案所需的推理代币数量也各不相同。据报道,Kimi 所消耗的代币量远远高于 Sol,这使得它的价格优势变得毫无意义。智能体也带来了类似的状况:在不同模型执行智能体工作流程时,它们所需代币的数量也存在差异,有些模型更为高效。

这意味着代币并非商品。商品的核心特征在于其可替代性:一加仑的石油就是一加仑的石油,一吨铜就是一吨铜,一蒲式耳小麦也是一蒲式耳小麦。然而,不同模型生成的代币彼此并不相同。真正具有可替代性的是由这些代币构成的东西,也就是智能。换言之,如果 Kimi 和 Sol 都能给出正确答案,那么这个答案本身是可替代的;而为了得到这个正确答案所生成的代币差异,则会导致成本结构的差异。

智能产品的成本由多个不同因素决定:

  • 模型规模:模型的权重与运行状态决定了运行每个实例需要多少昂贵的内存以及多少加速器。
  • 推理效率:特定的架构设计(例如专家混合模型)能够降低每生成一个代币所需的计算量。
  • 内存效率:通过合理的架构设计可以降低 KV 缓存的需求,从而支持更多并发请求,并提高 GPU 的利用率。
  • 服务效率:通过批量处理、任务调度、前缀缓存以及其它推理优化手段,能够最大限度地提升资源利用率,并在各类请求之间实现工作负载的共享。
  • 代币效率:得出正确答案所需的代币越少,推理成本就越低。

这之所以重要,是因为我们正迅速步入这样一种阶段:许多具有经济价值的任务所需的智能能力实际上已变成了一种商品。例如,任何想要开发基础 CRUD 应用的人,都很可能使用多家供应商提供的模型来完成它。而在商品市场中,实现盈利的途径并非通过提高价格——毕竟你可以(或者很快就能)用不同的模型做出完全相同的应用——而是通过拥有更优的成本结构。

理解商品市场

有必要仔细了解其中的运作机制,因为正如我几个月前在探讨 Amazon 的可持续发展问题时所指出的,商品市场的运行规律并非科技行业的人士普遍熟悉的领域。

  • 在商品市场中,由于所有人出售的都是相同的产品,因此大家都收取相同的价格;这个价格由供求关系决定。
  • 商品的需求取决于价格弹性:商品越便宜,其需求就越大,反之亦然。
  • 某种商品的供应量取决于生产该商品的边际成本。

需要理解的关键点是,不同供应商生产该产品的边际成本各不相同。实际上,这意味着那些成本结构最差的供应商最终只能以自身的边际成本出售产品(前提是他们还能成功生产);而其他供应商的利润则取决于其成本结构相比那些边际成本最高的供应商有多优。

例如:

  • 供应商 A 能够以每件 10 美元的价格生产 10 件该产品。
  • 供应商 B 能够以每件 15 美元的价格生产 10 件该产品。
  • 供应商 C 能够以每件 20 美元的价格生产 10 件该产品。

假设价格弹性使得该商品在 20 美元的价格下仍有 25 单位的需求。也就是说:

  • 供应商 A 将以 20 美元的价格出售 10 件该产品,每件可获利 10 美元。
  • 供应商 B 将以 20 美元的价格出售 10 件该产品,每件能获得 5 美元的利润。
  • 供应商 C 将以 20 美元的价格出售 5 件该产品,每件的利润为 0 美元。

这种说法并不完全准确:供应商 C 之所以要承担亏损,是因为供应商 A 和 B 能够以略低的价格竞争,这当然会影响到需求(而需求是具有弹性的),但核心观点依然成立。供应商 A 的生意非常好,供应商 B 的生意也不错,而供应商 C 则将会破产。

破产风险恰恰凸显了固定成本的重要性:供应商 C 不仅存在固定成本(如研发支出),可能还为了购置生产产品所需的设备而背负债务。在考虑这些成本的情况下,它无法为产品定价——要知道,市场均衡价格大致相当于满足需求所需成本最高的那个单位的边际成本——但这类成本完全有可能导致该供应商倒闭。而一旦该供应商破产,价格就会上升,直到有另一家供应商决定进入市场(或现有供应商扩大生产规模)为止。

智能市场

再把话题转回到模型上。目前上述分析都不再适用,因为前沿模型的需求远大于供给,而供给又受到算力不足的限制。这种算力短缺不仅意味着像 Nvidia 这样的算力供应商能获得极高的利润,也使得 Nvidia 的客户,比如 SpaceXAI,能够以较高的利润将算力转售给 Anthropic 这类公司。而 Anthropic 则有能力承担这些加价,因为他们同样可以以更高的价格出售代币。

不过,让 Anthropic 拥有如此高利润率的并不仅仅是过高的需求:得益于出色的模型性能、庞大的服务规模以及高效的令牌使用效率,Anthropic 与 OpenAI 在每单位前沿级智能服务所对应的成本方面很可能处于最低水平。他们在同类产品中率先以特定性能水准提供服务数月之久,同时还会运用最优秀的模型来进一步降低这些成本。

值得注意的是,目前市场仍未将智能技术视为普通商品:人们需求的是 Anthropic 与 OpenAI 这类模型,而对性能稍差的模型需求则要少得多(正因如此,SpaceXAI 和 Meta 才会向 Anthropic 出售算力资源);优化成本的努力可以理解为是根据不同的智能水平来界定所需完成的任务,从而让购买智能服务的一方能够打造出一个将智能技术商品化的市场。不过从长远来看,那些处于技术前沿的企业最有可能同时主导非前沿市场,而这些非前沿市场其实不过是前沿市场再减去 n 个月的时间——也就是那些前沿模型开发者一直在努力优化服务成本的那段时期。

总而言之,我认为至少从经济角度来看,人们对 Kimi 以及中国开发的人工智能模型的反应有些过度了。目前存在由于算力不足而导致的成本上升问题;我非常怀疑这些中国模型在边际成本层面真的更便宜,它们看起来更便宜只是因为 Anthropic 和 OpenAI 的供应严重受限,所以其收费远远高于在供应能够满足需求时的水平。

前沿实验室的恐慌情绪

那么,为什么模型开发者们尤其会对中国开发的模型如此恐慌呢?

首先,我认为那些处于技术前沿的实验室所依据的假设是:训练成本在它们的财务模型中占据主导地位。只要用于训练的 GPU 数量多于用于推理的 GPU 数量,那么最大化推理收入就显得至关重要,这样才能为下一次训练提供资金支持,而这也就意味着必须收取极高的推理费用。

不过,我预计未来推理市场的增长速度将会远远超过训练成本的增长速度(即便假设训练成本会持续飙升也是如此),这意味着它们完全可以通过更高的处理量来弥补成本差异。八个月前还很难确定会出现这种情况,但由于智能体技术带来的巨大突破,那些前沿实验室应该更有信心:只要拥有足够的计算资源,他们不仅能够生存下来,还能在更低的价格下实现蓬勃发展。

其次,智能其实并非一种完全标准的商品,部分原因在于应用型智能会让自己变得更聪明。具体而言,负责运行推理的人同时也在收集数据,而这些数据会被用于优化模型的下一版本。一方面,随着更多计算资源投入使用,前沿实验室更有理由降低价格并提升使用率;另一方面,这也正是像 Microsoft 这样的公司越来越热衷于帮助企业自行部署模型的原因。而如果中国开发的模型能够成为可行的替代方案,这种情况就会更加普遍。

第三,前沿实验室要想既区别于中国开发的模型,也能彼此区分开来,另一个办法就是不断深入整合到客户体验之中。Claude Code 与 Codex 的粘性之高令人瞩目——用户一旦开始使用某款工具,就很可能一直沿用它,对于非技术用户而言情况更是如此。从长远来看,这种向更高层次发展的趋势确实意味着这些前沿模型会对包括 Microsoft 在内的软件供应商构成威胁。不过,目前掌控着客户体验的软件公司如果能获得具有竞争力的模型,也就更有能力抵御前沿实验室的侵蚀。

最后,尤其不能忽视 Anthropic 在理念层面的立场。这是一家坚信只有自己才有资格掌控人工智能发展的公司,而开放权重模型这一替代方案则对其这种观念造成了致命打击。

中国动力十足的态势

Kimi 并非唯一的新款中国 AI 模型;据彭博社报道:

周一,阿里巴巴集团控股有限公司的股价涨幅高达 5.4%,原因是该公司推出了其旗舰模型 Qwen3.8 Max 的预览版本,并称该模型的性能仅略逊于 Anthropic 的 PBC 系列 Fable 5。就在几天前,初创公司 Moonshot AI 也推出了一款功能强大的新产品,这一举措引发了市场动荡,也让美国方面担忧中国正在缩小与 Anthropic、OpenAI 等全球领先企业的差距。Qwen3.8 Max 拥有 2.4 万亿个参数,可与 Moonshot 的 Kimi K3 相媲美,属于高性能级别产品;而 Kimi K3 的参数则为 2.8 万亿,已能与最顶尖的模型抗衡,阿里巴巴也对 Qwen3.8 Max 寄予了同样的高期望。

开发者现在可以通过阿里巴巴的编程平台,如 Qoder,来使用 Qwen3.8 Max。阿里巴巴计划很快将该模型转为开放权重格式,从而让更多人能够使用它,而不仅仅限于预览版本。由于对中国制造的这类人工智能系统及模型的需求极为旺盛,Moonshot 不得不在周日晚间暂停接受新的订阅申请,以应对巨大的需求压力。

值得注意的是,Qwen3.8 Max 也将采用开放权重设计。今年早些时候阿里巴巴曾停止发布其前沿模型的权重,但如今似乎又改变了这一做法;我推测这一变化与上周习近平关于人工智能的讲话有关,他在讲话中进一步强调了开放权重的重要性。

我们要坚持开放共赢的原则,推动创新驱动发展。作为世界经济增长的新引擎以及带动增长动力转型的加速器,人工智能正从数字世界走向物理世界。我们应当抓住这一难得的历史机遇,倡导开源、开放、协作与共享,促进人工智能在技术创新、产业发展及场景应用方面的发展。同时要在传统产业转型升级、新兴产业培育壮大以及未来产业前瞻性布局等方面协同推进,让各行业和企业都能从人工智能中受益。

中国的策略很明确:将其配套技术商品化。值得注意的是,习近平曾明确将开放性与人工智能“从数字世界走向物理世界”的趋势联系在一起;而物理世界正是由中国主导的领域,中国在机器人技术等方面的优势也将因广泛可用的人工智能模型而获得巨大益处。

同理,中国也不希望美国在人工智能领域获得不对称优势;只要能够削弱美国的领先研究机构,同时强化所有可能的美国对手,那就越好,而且中国还能从开放生态系统所带来的创新中受益。

蒸馏技术带来的挑战

同理,也不必指望中国会采取任何措施来应对针对前沿实验室的蒸馏攻击。将中国实验室的所有成功都归功于蒸馏技术固然有误,但假装蒸馏技术并未为中国实验室带来巨大优势也同样错误。随着训练后强化学习对模型性能的重要性日益提升,这一优势在过去一年里愈发凸显。中国实验室无需从头构建强化学习环境,只需以前沿实验室的模型作为基准,就能以更低的成本实现快速改进(这虽不是中国模型开发成本更低的唯一原因,却是重要因素之一)。

有趣的是,中国模型在西方最重要的应用场景之一其实就是蒸馏技术。例如,刚刚发布开放权重模型的 Thinking Machines 就依赖中国模型来解决强化学习中的冷启动问题。Dean Meyer 和 Konstantine Buhler 在 X 平台上发表了一篇精彩的文章,指出蒸馏技术意味着西方开放权重模型相比中国模型处于根本性的劣势:

蒸馏技术并不能完全解释中国在开放模型领域的领先优势。中国的研究机构拥有世界级的科研人才、强大的计算资源、出色的预训练模型,同时还具备软硬件协同设计的能力,其训练后的模型性能也在不断提升。而蒸馏技术则有助于缩小从强大基础模型到接近前沿水平的系统之间的巨大差距。即便蒸馏技术仅占中国模型整体性能的一小部分,但它依然构成了中国模型相对于美国开放模型的重要优势。

新的监管机制将使中国企业进行大规模模型蒸馏变得更加困难、缓慢且成本更高。不过,这类监管措施无法杜绝那些由国家力量支持的模型蒸馏行为。因此,西方在各个技术领域的每一次进步都会为中国实验室提供新的学习范本。西方开发者要么不得不独立开发出类似能力,要么只能通过中国模型来学习。这一差距让中国实验室始终拥有相对于西方企业的结构性优势。

这一点值得再次强调:由于美国的开源模型开发者必须遵守前沿实验室的服务条款,他们(1)表现不如中国的同类产品,(2)最终也不过是通过中国实验室来间接进行模型蒸馏而已。如果西方的开源模型开发者能够直接从源头获取模型,不是更好吗?

为此,关于蒸馏技术还有一个更有趣的问题:它究竟为何会被视为负面因素?毕竟,大型语言模型不正是对互联网上所有知识的提炼吗?这些知识由前沿实验室收集并整合进模型中,而这些模型本身又会进一步被提炼。那么,这里到底是谁受到了损害呢?

事实上,这种矛盾恰恰就是解决方案。我认为开放权重模型有利于创新(基于上述观点,我也觉得处于技术前沿的实验室不会受到影响),但依赖中国却是个问题。美国应当通过相关法律:首先明确将用于模型训练的数据收集视为合法使用行为;其次至少针对美国企业,禁止那些限制模型蒸馏的技术条款。实际上,阻止模型蒸馏几乎是不可能的,因为这只不过是调用 API 而已。美国应该采取相反的做法,制定新的版权政策,既能保护这些实验室的利益,又能确保他们所取得的成果能为其他人带来更多创新动力。

值得担忧的原因

整篇文章都在试图缓解人们对 Kimi K3 以及中国开源模型整体的过度反应;不过仍有一个值得担忧的问题,那就是网络安全。《The Stack》上的这篇报道值得关注:

Hugging Face 表示,上周初其生产基础设施遭到了一个“自主”运行的 AI 代理系统的攻击。该平台的安全团队在应对此次事件时遇到了阻碍,因为他们所说的某些未具名的美国 LLM 前沿模型防护机制“无法区分事件响应人员与攻击者”。于是,Hugging Face 的防御人员转而使用来自中国 Z.ai 实验室的开源 GLM 5.2 模型,在自身的基础设施上运行该模型,以此分析攻击者留下的 17,000 多条日志或痕迹。

对于总部位于纽约、致力于支持用户在模型、数据集及应用方面开展协作的 Hugging Face 而言,这无疑是一个令人瞩目的公开表态。该公司在今年夏季的营收就已突破 1 亿美元大关。在一份事故报告中,该公司建议防御方“事先在自身基础设施上准备好经过检验的可用模型,这样既能避免因防护措施导致系统无法正常运行,也能防止攻击者的数据与凭证泄露出你的系统环境”[重点为笔者加粗]。

特朗普政府对 Anthropic 发布 Fable 这一举措所做出的恐慌式反应实在错得离谱,这种反应简直再糟糕不过了——它进一步放大了 Anthropic 那种认为只有自己才有资格掌控强大 AI 技术的恶劣倾向。在只有一个 AI 存在的世界里,或许将最强大的网络安全能力留给美国政府及可信赖的盟友是合理的;但现实并非如此。

目前已有、而且将来还会出现那些极具能力、能够对现有基础设施发动网络攻击的模型,这类模型已经并且将会广泛存在。最有效的防御手段——事实上也是唯一可行的防御方式——就是确保防御方也能使用到最优秀的模型。由于特朗普政府的指令,当前防御方实际上被禁止使用 Fable 或 Sol 来进行网络安全防护;这意味着他们只能选择那些多年来一直试图削弱我们网络防御能力的国家的模型。这简直荒谬至极!

明确的最佳路径是:首先放宽 Fable 和 Sol 在网络安全方面的限制,其次确保美国的开源模型开发者能够与中国处于公平的竞争环境之中。没错,那些前沿实验室会对此强烈反对,但政府应当意识到,听信他们的抗议只会让美国企业陷入依赖中国来保障自身安全的境地。应让那些表现更出色的实验室通过实力取胜,而非让他们来定义安全标准或阻碍人类整体知识的进步。与中国竞争已经十分艰难,再让他们来制定开放与创新的准则,无异于放弃我们最大的优势。

了解 RecodeX-立足新加坡,洞察全球 AI 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读