返回首页
信息来源:akashbajwa.co 2026.07.27 05:08 约 5 分钟 AI 5,786 阅读

刻意稀疏:Kimi K3 与开放模型扩展

当 Moonshot 在 7 月 27 日发布 Kimi K3 检查点时,它将成为有史以来规模最大的开源模型:拥有 2.8 万亿个参数,100 万 token 的上下文窗口,支持原生多模态处理,其性能指标已超越 Opus 4.8,仅略逊于 Fable 5 和 GPT-5.6。

讨论的焦点一直集中在 2.8 万亿上。

更重要的数字是 16。

从 28%降至 2%

每处理一个令牌,K3 会激活 896 位专家中的 16 位——也就是说,在每次前向传播过程中,只有不到 2%的专家会被启用。这并非实现细节,而是开放模型中最为一致的架构趋势所达到的最终状态。

刻意稀疏:Kimi K3 与开放模型扩展

自 Mixtral 推出以来,参数总数增长了 ~20x 倍;仅在过去十二个月内,就增长了 ~3x 倍。

活跃参数几乎没有任何增长:在 27 个月内,17-49B 频段的情况始终没有变化。Moonshot 在九个月内先后发布了 K2、K2.5 和 K2.6 版本,这几种版本的架构完全相同——总内存为 1T,活跃参数为 32B;虽然发布了三个版本,但活跃参数并未出现任何增长。

存在一定的波动性(GLM-5.2 的稀疏程度低于 V4-Pro),因此这是一种带有方差的趋势,而非固定规律。不过其发展方向是明确的:保持每个标记的处理成本大致不变,同时不断提升整体处理能力。

为什么?因为在固定的训练算力预算下,专家数量越多,损失就越低。模型能够在相同的计算量下学到更多知识。而成本则由价格较低的存储资源来承担,而非那些稀缺且需要严格控制的资源——即算力和内存带宽。

开源实验室发现,获取情报最便宜的方式就是投入算力。

稀疏性在某种程度上是一种适应机制:当浮点运算次数受到限制时,就可以通过调整出口控制之外的参数来应对。

KV 缓存压缩

尽管专家权重越来越稀疏,但更长的上下文窗口会增大 KV 缓存的大小,而且与权重一样,每个标记生成时都需要从内存中读取该缓存。

正是在这里,相关的创新技术填补了这一漏洞。注意力压缩技术(DeepSeek 的 CSA/HCA 混合架构、多头潜在注意力机制,以及 K3 的新注意力架构)正在缩小缓存的大小。V4-Pro 在处理 100 万上下文长度的数据时,其 KV 缓存的容量仅为前代产品的 10%。

那些结构较为简单的模型能够减少每个标记所需要传输的权重字节数。而压缩注意力机制则能降低每个标记所需要移动的缓存字节数。在模型的发展路线图中,没有任何方案能够减少存储所需的字节数,这一数值只会持续上升。

每一种建筑趋势都在摆脱带宽短缺的困境,转而将容量视为决定性的限制因素。

约束从计算环节转移到存储环节

正是这种稀疏性,才使得 2.8T 规模的模型能够被实际使用。正如 Altimeter 的 Jamin Ball 所写的那样,这揭示了运行这类大型模型的真实成本:

从历史上看,促使模型采用开放定价模式(任何人都能使用该模型)的一个因素是:当“任何人”指的是“那些拥有超级节点,并且其服务架构是为全新的注意力机制而设计的用户”时,这一因素的作用就会大大减弱。

无论采用何种供应方式,2.8T 型号的出厂价格显然都高于 1T 型号。K2 时代之所以会有 10 倍的折扣,部分原因在于那些型号的体积更小,且利润空间也很低。而 K3 型号则只能提供后者这种优势。有两年时间,“低价”与“便宜”这两个词被混用,但实际上它们并非同一概念。

由于数据稀疏,基于单个标记的推理运算,其计算成本相当于一个中等规模的密集型模型。

从这个意义上说,稀疏性让前沿推断的计算实现了民主化。

它对提升处理能力毫无帮助。在 MXFP4 格式下,仅 K3 的权重就达到了 1001#1.4TB。光是加载这些数据就需要十几台 H200 计算机,更不用说 1M 窗口大小下的 KV 缓存需求了——正因如此,Moonshot 才建议采用“配备 64 台或更多加速器”的超级节点架构。

日益增加的稀疏性使得成本从计算转向存储。

两种供应制度

在小批量处理场景中(例如那些希望自行托管模型的企业),一种合理的方案是采用分层内存结构:最常被使用的模型参数存储在 HBM 内存中,而较少被使用的模型参数则存储在成本较低的 DRAM 内存中。这其实体现了 MoE 模型所遵循的某种幂律规律。

在超大规模环境中,这种成本/效率优势便不复存在了。生产服务器会同时处理数百个请求,每个请求都会选择自己的 16 位专家模型。在每次处理请求时,整个批次几乎会启用全部 896 个专家模型。因此,不存在那些“闲置”的专家模型。于是,系统会将所有资源集中在 64 个及以上加速器所配备的 HBM 上,再将请求路由到对应专家模型的芯片上。在这种情况下,数据的稀疏性并不会降低所需购买的 HBM 数量,反而会使得对带宽的需求转变为对 HBM 容量的需求。堆叠的层数越多,处理任务时的压力就越小。

在利用率较低的情况下,只有少数用户同时使用该系统,也就是那些仅有少量并发会话的企业。此时,专家模型确实处于“闲置状态”,因此可以将这些模型存储在系统的 DRAM 中,同时再加载其他模型来继续使用。对于需要使用开放权重模型的情况来说,这种模式尤为重要,因为下载检查点的目的就是为了能够在非云服务提供商的环境中运行这些模型。而由于模型的稀疏性,才使得针对万亿级模型而言,自托管方案成为一种可行的选择。

路由策略至关重要。目前的路由器会将任务大致均匀地分配给各个专家,正因如此,按性能等级对专家进行分类的方法在处理大量任务时就会失效。如果让路由器按照一定的规律来分配任务,比如优先让那些表现较好的专家处理任务、选择可预测的路径,那么即便需要处理大量任务,也能实现有效的任务分级;同时,使用成本较低的 DRAM 内存的方案也会更具优势。

了解 RecodeX-立足新加坡,洞察全球 AI 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读