DeepSeek 以一篇论文开启 2026 年,释放出以更低成本训练更大模型的信号
本文信息来源:scmp
DeepSeek 发布了一篇由创始人梁文锋共同署名的技术论文,提出对其核心深度学习架构进行重新思考

中国人工智能初创公司 DeepSeek 以一篇新的技术纸开启了 2026 年,该论文由创始人梁文锋共同署名,提出重新思考用于训练基础 AI 模型的基本架构。
这一方法——被称为 Manifold-Constrained Hyper-Connections(mHC)——是这家杭州公司提升模型成本效益的努力的一部分,旨在在计算资源获取更为充足、资金实力更雄厚的美国竞争对手面前保持步伐。
这也反映了中国 AI 公司日益开放、协作的文化,它们将越来越多的研究公开发布。
对行业观察人士而言,DeepSeek 的论文常常提供一个重要的早期信号,揭示将塑造这家初创公司下一次主要模型发布的工程选择。
在这篇于周四发布的论文中,由 19 名 DeepSeek 研究人员组成的团队表示,他们在拥有 30 亿、90 亿和 270 亿参数的模型上测试了 mHC,发现其可以实现扩展而不会增加显著的计算负担。
由谢振达、魏逸轩和曹焕琪领衔的研究人员写道:“实证结果证实,mHC 能够有效地……[实现] 稳定的大规模训练,其可扩展性优于传统的 HC(超连接)。”
梁被列为期末考试作者。
该团队还补充称,“关键在于通过高效的基础设施层级优化”,mHC 在“几乎可以忽略不计的计算开销”下实现了这些提升。
这篇论文还提供了新的证据,表明尽管 DeepSeek 的知名度不断上升、梁文锋本人一直保持低调,但他仍然深度参与了这家中国最受关注的人工智能公司之一的核心研究工作。
超连接最早由字节跳动研究人员于 2024 年 9 月提出,作为对 ResNet(残差网络)的一种改进。ResNet 是一种占主导地位的深度学习架构,于 2015 年由包括传奇中国计算机科学家何恺明在内的 Microsoft Research Asia 科学家提出。
ResNet 通过稳定训练过程,使关键信息或残差在层数增加时得以保留,从而能够训练非常深的神经网络。

它已成为包括 OpenAI 的 GPT 以及 Google DeepMind 荣获诺贝尔奖的 AlphaFold 系统等主流大型语言模型的核心组成部分。
然而,ResNet 也存在显著局限性,包括在神经网络中难以确保学习信号在传递过程中保持足够强度,而不“塌缩”为一种千篇一律的状态。
据 DeepSeek 研究人员介绍,字节跳动的 HC 方案通过扩展残差流并提升神经网络的复杂性,成功解决了这些问题,同时“并未改变单个单元的计算开销”。
不过,DeepSeek 指出,早期的方法并未充分考虑不断上升的内存成本,因而在大模型训练方面,其“实际可扩展性”仍然受到限制。
相反,他们提出了一项额外的调整,通过特定的流形对 HC 网络进行“约束”,以确保计算效率和成本效益。
研究人员写道:“mHC 将有助于解决当前的限制,并有可能照亮下一代基础架构演进的新路径。”
该论文由 DeepSeek 首席执行官梁文峰本人上传至开放获取代码仓库 arXiv。近年来,他也曾发布 DeepSeek 更重要的技术论文,包括与其 R1 和 V3 模型相关的研究成果。
其他不那么重要的论文通常由其他研究人员上传。
德国特里尔大学的哲学博士学生、以及中国 AI 生态系统专家 Florian Brand 表示,DeepSeek 的论文往往成为其下一代模型技术发展方向的早期信号。
业内普遍预期,DeepSeek 有望在 2 月中旬春节假期前夕发布其下一款重要模型。
此前,该公司曾在去年国庆假期前夕发布了具有突破性的 R1 模型,这引发外界猜测其今年可能会再次复制这一策略。