NeurIPS 2025:什么才是真正重要的
本文信息来源:insights
那些暗示 2026 年及以后垂直 AI 未来走向的论文
2025 年 12 月份,年度 NeurIPS 大会在圣地亚哥和墨西哥城汇聚了数以万计的与会者,回顾并深入讨论了超过 2 万篇研究论文,让其余的我们得以一窥未来一年 AI 发展的走向。
随着 AI 热潮的推进,这场大会本身也发生了变化。NeurIPS 已不再是由研究生主导的小众学术聚会,而是完成了向全面行业 Trade show 的转型。尽管尚未达到 CES 的规模,但今年的大会充斥着大型展台、商业产品发布,以及来自全球最大模型构建者的低调信号传递(即市场营销)。
鉴于 AI 产业的重要性和规模,这种情况或许很自然。一个奇特的潜在暗流在于,随着注意力和规模的急剧膨胀,信息发现本身所固有的问题也随之而来。与会者讨论了一个不可回避的事实:即便是在 5,000 篇被接收的论文中,也有许多显然是借助 AI 辅助撰写的。然后还有一个挑战——从 20,000 篇投稿筛选到 5,000 篇接收,再到最终只有少数获得奖项的研究论文 。在 NeurIPS 2026 上,有多少论文会在撰写、评审以及获奖的过程中(至少在一定程度上)由这场会议所要研究的那项创新本身所完成?既令人担忧,又令人兴奋。
无论如何,在 Euclid,我们的人数要少得多——而且几乎可以肯定,在神经天赋上也不及 NeurIPS 的评选委员会。但我们确实认为,他们选择重点展示的发展成果,是衡量垂直 AI 脉搏与未来走向的重要指标。
在本文中,我们尝试总结最重要的五篇论文(其中除一篇外均获奖)。希望这些内容能为同样在努力理解最新 AI 研究进展的普通投资人和运营者提供一份有帮助的指南。当然,我们的主要重点是为 Vertical AI 创始人提供相关的关键洞察与影响,帮助他们在思考 2026 年创新趋势走向时作出判断。

大局观
从更宏观的角度来看,以下是 NeurIPS 2025 的三大元主题:
- 效率正当其时 :通过更好的底层管道而非更大的模型来寻求提升。
- 模型正在趋同: 差异化可能正在向技术栈的上层转移。
- 规模定律正在超越语言领域扩展 :强化学习正在回归。
基于这样的框架,以下是值得关注的五篇论文。
1. 人工蜂群思维:语言模型的开放式同质化
全文论文链接 | 要点:LLMs 正在收敛到相同的想法。
这篇论文对许多从业者直觉中已感受到的现象进行了形式化总结:
当你向当今的前沿模型提出开放式问题时,它们的回答越来越像是同一个大脑换了不同的外壳。
作者介绍了 Infinity-Chat,这是一个包含 26,000 条真实、开放式提示和 31,000 条人工标注的基准。在不同模型和厂商之间,他们观察到在措辞、结构,甚至价值观上的显著趋同——尤其是在创意性或基于判断的任务中。
这不仅关乎创造力,而是关乎行为上的趋同。模型正在坍缩到一个共享的“行为盆地”,在其中,厂商选择的重要性已不如以往。
这为什么重要
如果所有主流模型都趋同于一种被平均化的世界观,任何偏见或盲点都会同时在各处传播。对齐和安全目标——尽管是必要的——可能正在悄然以牺牲多样性、本地判断和少数群体偏好为代价。
对垂直 AI 的启示
垂直软件依赖于情境。在牙科、建筑贷款、物流或保险等领域,什么是“正确”的答案很少由共识驱动。这篇纸是一种警告:如果你的垂直智能体没有被明确地针对领域特定差异进行评估,它可能只是在回声式地复述全球蜂群思维。因此,你的“模型选择优势”可能并不相关。
差异化越来越多地来自数据、评估和激励机制,而不是你在某个时间选择了哪一个模型。
2. 大型语言模型的门控注意力
全文论文链接 | 要点: 无需增加算力即可获得更好的注意力。
本文提出了一个看似简单但颇具巧思的架构改动:
在每个注意力头之后添加一个 sigmoid 门控,相当于为模型提供一个调光开关,用来控制每个注意力头对输出的影响程度。
在约 30 个大规模实验中(包括万亿级 token 规模),这一改动提升了训练稳定性、长上下文表现以及整体性能,同时还修复了一个已知问题:早期 token 在注意力中占据主导地位(“attention sinks”)。
重要的是,这并不是关于规模扩张,而是关于更干净、更高效的基础架构。
这为什么重要
这些变化往往不会登上头条——但六个月后你会发现, 相同规模的模型更便宜、更稳定,幻觉也更少。这是通过设计实现的效率提升,而非蛮力堆砌。
对垂直 AI 的启示
垂直领域的工作流程被冗长且杂乱的输入所主导:EMR 导出文件、合同、理赔历史、交易日志、承保资料包等。任何能够提升长上下文可靠性、且不导致代币成本暴涨的改进,都会直接提升产品质量——这是一次巨大的胜利。
应用层运营方不会自行实现 gated attention。但随着模型(不可避免地)采用这一机制,你将从中受益,这可能会推动垂直 AI 工作流的显著改进。
3. 强化学习真的能创造更强的推理能力吗?
完整论文链接 | 要点:RL 只是在强化推理,而不是发明推理。
这篇论文为基于 Reinforcement Learning(RL)的微调方法(RLHF、RLVR)提供了一次迫切需要的现实校验。作者指出,尽管 RL 能提升采样效率——让模型更频繁地选出优质答案——但它并不能创造本质上全新的推理能力。
这些推理路径在基础模型中已经存在。RL 只是对它们进行重新加权。新的推理模式(即创造力)反而是通过蒸馏引入的。
这为什么重要
这戳破了一个行业中常见的叙事:认为只要不断叠加更多的 RL,就能持续解锁更聪明的模型。如今的 RL 技术主要是在打磨既有的智能,而不是扩展它。
对垂直 AI 的启示
如果你的策略是“我们将通过 RL 微调一个基础模型,使其成为领域专家”,那么这篇论文是你应该内化的一个约束。RL 在可靠性、一致性和性能优化方面依然非常出色。
领域智能仍然主要来自基础模型的选择(以及其推理 / 记忆能力)、数据、工具,以及工作流集成。
4. 为什么扩散模型不会记忆
完整论文链接 | 要点: 扩散模型在记忆之前就已经实现了泛化。
这篇理论论文探讨了一个备受争议的话题:扩散模型是否只是简单地记忆其训练数据?
作者表明,扩散训练包含两个阶段:(1) 学习 :早期阶段,模型学会生成高质量且多样化的样本;以及(2) 记忆 :后期阶段,随着模型开始对高度特定的输入过拟合,训练数据被整体性地记入模型。
关键的发现是,随着数据集规模的增长,记忆化阶段会被进一步推后。这会形成一个不断扩大的安全训练窗口(例如,更长的一段时间,在这段时间内模型可以持续增强,而不会冒着发生记忆化/过拟合的风险,从而可能导致等同于知识产权盗窃的问题)。
这为什么重要
这重新框定了关于 IP 和 隐私 的讨论。它为“扩散本质上就是 盗窃”这一观点提供了一个有力的反驳。通过训练决策,AI 工程师可以在 学习 转变为机械记忆之前按下暂停键。因此,评判标准可以变为:你使用了多少数据,训练了多长时间,是否在过拟合之前停止,以及模型是否能够复述我们的 IP?
对垂直 AI 的启示
使用生成式视觉或信号模型的垂直领域——放射学、病理学、工业检测——需要有原则性的方法来论证其具备泛化能力而非仅仅是记忆能力。这篇论文提供了这样的理论基础。
这并不会消除数据隐私风险,但它让相关讨论更加客观、可验证——而更便捷地获取一方数据在垂直 AI 中具有明确价值。
5. 用于自监督强化学习的 1000 层网络
完整论文链接 | 要点: 深度 RL 终于实现了规模化。
从历史上看,强化学习(RL)依赖浅层网络(2–5 层),因为研究人员认为 RL 产生的信号不足以支撑更深的网络。
这篇论文彻底推翻了这一假设。
通过在自监督、目标条件化的环境中训练拥有数百到数千层的网络,作者在控制任务上实现了 2–50 倍的性能提升。
一旦研究人员不再吝啬模型深度和算力,强化学习就开始像几年前的语言和视觉一样运作:幂律扩展开始奏效。
这为什么重要
这大幅提高了智能体系统的上限。虽然家用机器人尚未真正到来,但支撑它们的基础性工作正在逐步到位。
对垂直 AI 的启示
这可能在短期内对物理 AI 影响最大——例如面向运营密集型垂直领域的机器人(仓储、物流、医疗、工业自动化),在这些场景中,AI 将不再只是推荐行动,而是直接执行行动。
除了机器人领域之外,这些强化学习(RL)的发现也应当适用于任何原位垂直学习场景,在这些场景中,需要被优化的是具体任务(而非推理本身)。

2026 年该问的问题
我们从 NeurIPS 2025 得到的唯一结论是:如果你——作为创始人或投资者——还只是在问“我们在用什么模型?”,那你可能问错了问题。或者至少,还有一些问题需要同时去问。
更好的问题可能是:
- 这个模型能否可靠地进行推理,并利用工具来完成这一过程?
- 它如何从其声称服务的工作流中进行学习 ,以及如何召回学习成果?
- 它是在学习,还是在记忆——这对隐私 & IP 风险意味着什么?
- 我们如何对推理、学习、记忆和隐私进行细粒度的衡量 ?
- 模型能否高效运行,并考虑用户身处何地,以及他们愿意支付多少?
在垂直领域 AI 面临的大量问题和机遇之下,我们预计 NeurIPS 的研究投稿数量将在 2026 年继续增长。因此,除了这些实践层面的问题之外,我们也非常期待看到该领域最顶尖的人才将如何利用 AI 来解决他们自身的问题。
也许明年,人类将不再选择任何胜者。