拥有而非租赁智能,从未像现在这样重要。即使在先进模型出口管制实施之前,这一点就已成立。

前沿模型代币成本是最佳开源模型的 10 倍。

人工智能分析

评估每项任务的成本时,情况同样严峻。

人工智能分析

现实是,大多数企业软件工作流程并不需要前沿智能。

人工智能分析

拥有智能而非租赁智能的理由不仅是经济上的,也是基于性能的。

我清楚地认识到,智能在此是一种运行时现象。两组字节完全相同的权重,在部署时可能带来截然不同的体验:其服务的精度与量化程度、缓存管理方式、请求落入的资源池、超前运行的推测解码器、推理努力程度,以及多租户环境下的干扰邻居——所有因素都会产生影响。

如果你不拥有推理服务引擎,那么精度、KV 缓存的页面分页或量化方式、请求的批处理与调度机制——所有这些选择都成了供应商有权自行更改而无须告知你的事宜。但如果你拥有它,那么当输出发生变化时,你就有追责手段:你可以通过 Git 溯源或二分定位来排查问题,而不是在 r/某个论坛上对供应商发火。

Adam Azzam

Modal 的 Adam Azzam 将模型权重比作母带:纯净无瑕,一次混录,存放于库房。但人们从未直接聆听母带,而是通过他人掌控的调音台与空间播放——即那些实验室。

那条回放链就是服务基础设施:路由、量化/精度、缓存、批量处理、推理投入。这就是为什么即使模型相同,你的产品却在评估中出现退步的原因。

除了服务基础设施,Fireworks 的 Lin Qiao 认为,前沿领域远不止 AnthropicOpenAI 的最佳闭源模型。

不存在单一的前沿,而是存在众多前沿。

  • 前沿模型是一种前沿。
  • 基于多年专有公司知识进行后训练的模型则是另一回事。
  • 一个能够比任何其他模型更好地解决某个狭窄问题的专用模型,则是另一种情况。
  • 一个将请求路由到多个模型集合的路由器,使这些模型协同工作,在许多任务上超越任何单一模型的表现。

多家应用型 AI 公司已加大力度自主掌控智能技术。最典型的案例是 Harvey,该公司已发表多篇论文阐述如何针对其领域进行模型后训练,促使联合创始人 Gabe Pereyra 详解其正在探索的多个研究方向:

In post-training Nvidia’s Nemotron family, they’ve pushed out the Pareto frontier.  

Harvey,Trajectory

Harvey 的 Legal Agent BenchmarkCursor 的 CursorBench、Rogo 的 Big Finance Bench 以及 Cognition 的 Frontier Code,都是 Sarah Guo 所描述的企业工作中”不可训练领域”的典型案例。

奖励所在之处,是最后那块不可攻克的阵地——其正确性仅存于私域的高阶工作。在托管着 AI 原生先锋企业的推理云中,定制模型生成的标记已占绝对主导,通用开源模型望尘莫及。

真正决定真金白银的评估是私有的、因企业而异的:这家企业在这类事务上会认可什么样的成果才算合格,而这一标准远未完善,因为法律的深度远超任何公开测试。OpenEvidence 正在界定什么是安全的临床答案。这本质上并非测量,而是关于何为真实、何为优良的判断,需要以书面形式确立,直至成为衡量他人的标准。无论基础实验室多么聪明,都无法制定这一标准,因为这种权威只存在于行业内部。

莎拉·郭

如果应用型 AI 公司能够通过特定领域的评估不断优化,萨提亚·纳德拉和微软 AI 相信,企业同样可以做到。

企业需要将自身的工作流程、领域知识和积累的判断力转化为可随每次使用而持续优化的 AI 系统。私有评估体系应能真实衡量模型是否在改善与业务相关的关键成果(而非仅关注外部基准测试!)。私有强化学习环境应能让模型基于企业内部的真实业务轨迹持续增强能力。其知识库使机构记忆变得可查询,并提升数据单元的使用效率。

萨提亚·纳德拉

MAI-Thinking-1 技术报告详细解析了企业构建自身爬坡式智能系统所需的各项组件。

将数据管道构建、训练基础设施、强化学习环境与奖励机制、评估套件以及安全测试整合为一个完整流程,使模型开发转化为针对特定领域的实证优化循环。

优化不止于此。

拥有智能在成本和性能上有着明显优势,但系统工程的挑战依然存在。

微软倡导的经验优化循环不仅是为了在性能上实现爬坡,更是为了在多个维度上取得进展。

越来越清晰的是,能量是人工智能推理的终极瓶颈。工作负载与装备的匹配是一种狭窄的优化形式,需要扩展到衡量每瓦特的智能水平。

在追求这种优化的过程中,所需的复合系统工程类型变得更加清晰。

Image
布莱恩·阿姆斯特朗

萨提亚·纳德拉:以今天与 Land O’Lakes 展示的例子来说,这里有一个智能体,而你所关注的是最终结果。我既可以使用 500B 参数的模型,也可以使用 5B 参数的模型来实现完全相同的效果,既然如此,为何不选择后者呢?

本·汤普森:这确实是这个时期一个非常不同的特点。显然,这将成为未来企业领域的一件大事——使用正确的模型进行优化,就像我们在 PC 时代还没达到优化阶段一样。

OpenRouter 的复合融合模型是迄今为止最好的例子。

Gemini 3 Flash、Kimi K2.6 和 DeepSeek V4 Pro 的组合成本约为 Fable 5 + GPT-5.5 组合的 20%,而在深度研究基准测试中仅逊色 4%。

DRACO benchmark scores for Fusion and solo configurations
源:OpenRouter
Score vs cost per task for Fusion and solo configurations
OpenRouter

基于这些原因,我认为方案一和方案三拥有最强劲的顺风势头,其将对前沿实验室经济模式、云端推理以及整个技术栈的利润率产生显著的二级效应。

Image
指数视角