广袤无垠的边疆
Kimi 与 Qwen 再度发力,将原本处于劣势的重量级竞争转变为对现有人工智能系统的战略威胁。

人工智能发展得如此迅速,是因为这个行业里不存在忠诚度可言。顾客会更换使用的产品型号,开发者会更换 API,投资者则会改变自己的观点。通常在出现一个行业基准数据以及两条推文之后,昨天的“天才”就变成了今天的落后者。
通过这一切,有一个信念依然存在:开放型模型虽然能够达到不错的性能,甚至非常出色,但始终无法超越最顶尖的水平。它们虽实用、成本更低且可定制,却仍只能处于第二位。
上周,这一信念遭到了沉重打击。
Moonshot AI 推出了 Kimi K3,这是一种拥有 2.8 万亿个参数的模型,专为编程、长上下文推理以及智能任务处理而设计。
阿里巴巴随后推出了 Qwen3.8,这是一款拥有 2.4 万亿个参数的旗舰模型;在初步测试阶段过后,其模型权重预计将会被公开。

两家中国实验室在短短几天内分别推出了参数范围在~2.5 至 3T 之间的模型。它们都采用开放架构作为部署策略,且目标都是用于处理编码、推理以及智能代理相关任务。
开放型模型不再争夺剩余资源,而是致力于处理那些能为美国模型提供商带来最高收益的工作负载。
Kimi K3:开放重量级迈向新巅峰
Kimi K3 在人工智能分析指数上的得分为 57,其整体智能水平与 Claude Opus 4.8 和 GPT-5.5 处于同一区间,但仍低于 Claude Fable 5 和 GPT-5.6 Sol。
它在代理任务中的表现最为出色。
在 GDPval-AA v2 测试中,K3 的等级分达到了 1668 分,这一数值远高于 Kimi K2.6 的 1190 分。它甚至超过了 GLM-5.2、GPT-5.5 以及 Claude Opus 4.8,不过仍低于 Claude Fable 5。
它在 AutomationBench-AA 上的任务完成率也达到了 53%,因此在评估 Zapier 的代理型 SaaS 工作流时,其在人工分析方面的表现位居首位。
在用于评估长周期知识工作的 AA-Briefcase 测试中,K3 的 Elo 评分达到了 1547 分,仅低于 Claude Fable 5。它的分析能力与评分表现已接近 Fable 的水平,不过在内容呈现质量方面,GPT-5.6 Sol 仍更胜一筹。
K3 在处理需要使用工具的复杂工作流程方面表现尤为出色,而这类工作流程很可能会决定下一代企业级人工智能系统的应用模式。
与它的前代产品相比,它在生成标记方面的效率也更高。在人工分析机构进行的九次智能指数评估中,该模型仅使用了大约 1.32 亿个输出标记,这一数值比 K2.6 少了 21%,同时却取得了显著更好的评估结果。换句话说,这款模型不仅规模更大,功能也更强大,且输出内容更为简洁有条理。

针对 K3 的主要批评是,它的体积过大,无法在普通消费级硬件上运行。


没错。其实,这种情况并没有听起来那么糟糕。“开放”并不意味着“必须在笔记本电脑上运行”。所谓“开放”,指的是相关技术不在某个单一供应商的控制之下。企业可以自行检查这些技术、对其进行定制、自行托管,或者委托他人来处理相关事务。这与通过 API 来使用由他人控制其价格、行为和可用性的技术,有着本质上的区别。
K3 或许无法让每个开发者都能独立进行推理,但它确实让那些有能力运营或出资请人运营重要基础设施的机构能够平等地拥有这些设施。
证明基米成功的最有力证据是:由于需求超出了现有计算资源的能力,《Moonshot》不得不停止接受新的订阅请求。

对于全球最新的开放型商业模式而言,最大的问题就是有太多人想要使用它。在商业领域,这被称为一种“虽不愿出现却又不得不面对”的问题。
Qwen3.8:在相同压力下,背后有大型云计算公司支持
阿里巴巴的 Qwen 3.8 从不同的战略角度推动了同样的趋势。
Moonshot 是一个雄心勃勃的 AI 实验室,它证明了自身具备在前沿领域与最强对手竞争的能力。而阿里巴巴则是一家提供云服务、企业级平台以及开发者生态系统的公司,同时还拥有处于行业前沿水平的模型技术。
这让 Qwen3.8 拥有了截然不同的市场推广路径。
阿里巴巴可以将该模型集成到各种云服务、编程工具、企业软件以及智能代理平台中。它还能将推理功能与基础设施相结合,通过更广泛的客户关系来降低用户的使用成本,并围绕自身的模型优化整个技术架构。
基米制造能力压力。权恩制造分配与经济压力。
中国开始掌控节奏。
多年来,人们一直认为美国实验室会开创新的技术方向,而开源模型最终能够以更低的成本实现同样的成果。但现实已不再支持这一假设。
中国的研究机构正在按照自己的节奏,大力推动大规模稀疏架构、百万 token 级别的上下文窗口、多模态系统的发展,同时采用极具竞争力的定价策略,并开放模型权重。这样的战略举措旨在让所有封闭式模型的优势都显得短暂无力。
在过去的几年里,这些模型实验室一直在努力转型为平台。而开放权重机制则有可能让它们重新变回组件供应商。

这对那些拥有专有模型的供应商来说是个问题,因为稀缺性正是他们商业模式的基础。开放权重会削弱这种稀缺性,降低用户更换供应商的成本,增强买方的议价能力,进而使得那些凭借暂时性的技术优势来收取高额费用变得更为困难。


华盛顿对中国模式的日益担忧其实很能说明问题。如果中国模式真的那么糟糕,就没人会讨论要禁止它了。保护主义不过是披着监管外衣的恭维话罢了。
关于中国开源模型的监管争论,很容易被简化为国家安全与技术开放之间的二选一问题,但现实要复杂得多。
这些风险确实存在:由中国提供的 API 可能会让敏感数据泄露给外国势力,相关模型可能被用于实施内容审查或体现政治偏见,而功能强大的开源模型则会降低网络、军事或生物领域被滥用的可能性。
然而,全面禁令很可能会存在漏洞,还会造成经济扭曲,并在地缘政治层面适得其反。一旦模型权重被公开,就很难再将其控制住。此类限制会对那些愿意遵守规定的美国企业造成更大压力,同时也会增加初创企业的成本,降低价格竞争程度,进而帮助那些已经极力推动模型稀缺化的国内企业维持优势地位。
那将是一个极其惊人的“自摆乌龙”,它会让中国成为新兴市场中易于使用的人工智能技术的领头者,而美国则会被视为依赖昂贵且需许可才能使用的智能技术的国家。

更明智的做法是监管风险的实际来源,而非开发者的国籍:
-
限制在敏感环境中的国外托管服务,
-
对于本地部署的模型,需要对其来源、安全性及行为表现进行严格的测试。
-
对任何超出明确设定的危险能力阈值的模型——无论是中国的还是美国的——都应实施对称控制。
-
将最严格的管控措施集中在那些关键且难以绕过的环节上,比如高端计算设施、军事用途以及重要基础设施。
与禁止使用那些令人恐惧的外国模特相比,这种方法在情感层面上带来的满足感较低。不过它的优点在于能够真正解决相关风险问题。
托管的 API 与下载下来的权重也应被区别对待。将敏感数据发送到受外国司法管辖区管辖的基础设施中,会带来数据主权方面的风险;而在美国公司自身的环境中使用这些权重,则会带来不同的风险,因此需要采取不同的监管措施。
面对基米和 Qwen 的挑战,美国的战略应对方式不应是孤立中国的称重技术,而应是打造更强大的美国开放式生态系统,从而在性能、可靠性、成本以及分销能力等方面与对手竞争。既然技术发展趋势越来越开放,美国就应该努力塑造这一趋势,而非退缩避让。