深度文章
信息来源:sequoiacap.com 2026.08.26 03:47 约 6 分钟 商业洞察 新发布

掌控你的智慧:操作指南

关于拥有你的智能的呼声正在升级……

最近,亚历克斯·卡普鼓励企业“拥有生产资料”。不久之后,萨提亚·纳德拉宣称,从前沿实验室购买智能就像是支付了两次:一次用金钱,另一次用你为了使 تلك 智能有效而暴露出的专有知识。

每个人都在问:谁应该拥有你业务核心的智能?

明确来说,拥有你的智能并不是要求或建议你离开实验室。对于许多工作负载,前沿的API和代理仍然是正确的答案。但是在我们的投资组合中,越来越多的公司正在为其产品的部分构建自己的AI能力,垂直整合以拥有和塑造它们的权重。

几周前,红杉资本聚集了一群AI创始人和建设者,举办了一场关于拥有你AI堆栈的活动。我们让哈维给我们带来了以客户为导向的视角。然后Mercor、Langchain、Trajectory和Fireworks向我们介绍了后训练堆栈中的技术构建块。

在各个演讲中,显现出一个清晰的行动手册。

为什么是现在?

首先,开放权重的前沿发展比预期更快。Kimi K3和GLM 5.2非常出色!在开放模型上进行训练曾经像是在跑步机上……你可能花了几个月进行微调,而下一个前沿版本将抹去你的成果。现在,你可以从接近前沿的基线开始。

其次,独立的后训练堆栈已经成熟。多亏了像Mercor和Fireworks这样的公司,每个公司都可以访问前沿研究实验室的技术堆栈,从训练到推理再到人类或合成数据。通过强大的评估、工程工具、后训练和在线学习,开放模型现在可以在特定领域超越前沿模型。

一年前,当性能是你可以牺牲的东西时,你选择开放权重。现在,这正变成一个生存和战略性的问题。最新的战场是智能层。不是你的权重,不是你的产品。

什么时候该采取行动?

没有一种通用的方法。除了性能之外,产品的某些部分可能会因为租用智能而受到限制,因为…

  1. 成本。您的AI产品越成功,您的AI COGS就越高。如果推理成本与使用直接相关,拥有模型则是保护利润的最佳方式。

  2. 速度。如果您在编码(如标签自动完成)或网络安全等领域运营,小型的定制模型可能会胜过大型的通用模型,因为速度非常重要。

  3. 专有数据。如果您的反馈、评估、客户互动或领域数据是让系统变得更好的关键,您可能更希望这些数据保留在您的公司内部。

  4. 控制您的命运。应用层与智能层正在开始融合。实验室正在向产品转移,应用公司也在深入定义产品思维的训练循环。拥有产品越来越意味着控制更多的学习循环和智能本身(致谢Harvey Research、RampLabs、Glean、Factory等)。

    掌控你的智慧:操作指南

    什么是路线图?

假设你已经确定了自研还是租用的策略,那么问题来了:你如何从零到一?

组建你的团队。不要把它硬塞进平台团队。要掌控你的智能,需要积极进取的人员:构建评估体系,塑造数据,试验开源模型,调整工具链,并在特定领域推动性能提升。小规模的全新团队能在这里取得巨大进展,并与六七个生态系统合作伙伴协作。例如,Harvey 已经完成了令人惊讶的大量研究工作,团队仅有七人!

让工作成果透明化。当前每个买家都在选择他们的 AI 领导者。越来越多地,决定胜负的因素是已发表的研究、基准测试或技术文章。如果你选择内部进行出色的研究,请与生态系统分享。

执行技术步骤。我们在下面列出了一个高层框架。

掌控你的智慧:操作指南

1/ 评估

Harvey 的 Gabe Pereyra 说得好:“如果你没有好的基准,就无法训练模型。”

评估是一组任务,用于衡量你的系统是否能够很好地完成工作。每个任务包含一个提示、模型可以使用的上下文和评分标准。大多数评估开始于创始人审视输出并进行感觉检查,以判断是否合适。目标是将这种判断转化为可重复的东西。

Harvey 通过将真实法律工作转化为离散任务来构建其法律代理基准,以便对模型进行测试。第一版包括超过 1200 个代理任务,涵盖 24 个法律实践领域,并通过超过 75,000 项专家编写的评估标准进行评估。

在决定是否拥有自己的智能之前,拥有评估是非常重要的。一旦每个前向传播都有评估,决定使用哪个模型就可以是一个经过衡量的决定,而不是猜测。

2/ 驾驭和上下文工程

一个代理有三个部分:模型、上下文和驾驭。驾驭管理围绕模型的产品逻辑:路由、检索、工具、记忆、后备和痕迹。Harrison Chase 的简洁框架是:“驾驭的主要工作是在正确的时间将上下文带给模型。”任务对模型的分布越外,现成的驾驭效果就越差。

一个好的驾驭让你能将任务路由到你特定工作的最佳模型,跨模型重用相同的评估,并决定代理获取的上下文和工具。它还使代理变得可检查。你可以追踪输入了哪些上下文,调用了哪些工具,以及在哪里被卡住。

3/ 后训练

后训练包含几种技术。合适的方法取决于你想要改善的内容。

Lin Qiao 阐明了这一点:如果模型缺少事实,你不需要后训练——只需使用上下文或 RAG。如果输出格式或行为错误,请使用监督微调。如果问题是产品口味,请使用偏好调整。如果模型需要在特定任务上提高,请使用强化学习(RL)。如果模型太慢或太贵,请进行蒸馏。

目标是选择提高你的评估的最轻松的方法。然后通过相同的驾驭服务模型,并在运行时测量质量、延迟和成本。

4/ 在线学习

一旦系统拥有其组件——评估、驾驭和模型——最后一步是在生产中改进该系统。

Arjun Karanam 提出了一个好观点:模型不断变得更聪明,但每次会话都像是它们第一天上班。你可以把 Terence Tao 放在一家会计公司,但可以肯定的是(至少在第一天)他不会是那里最优秀的会计师。缺失的是经验,而不是智能。代理在运行时创造了这种经验。

轨迹是任务的路径:模型看到的上下文、调用的工具和子代理、产生的答案,以及用户编辑、撤销或重试的内容。在像 LangChain 的 LangSmith 这样的工具中捕获这些轨迹是构建连续生产循环的必要条件。失败的任务变成了评估。缺失的信息进入上下文或记忆。糟糕的工具响应变成了驾驭修复。

最后的思考

买家须知:拥有自己的智能会打开潘多拉的盒子。

封闭的模型堆栈很简单。你调用一个前沿模型,使用现成的驾驭(例如,Claude Code 或 Codex),添加提示和上下文,然后发布。这给你一个高起点,但也有一个较低的上限。

拥有自己的堆栈意味着承担更多的系统责任。生产堆栈变成你的开源模型、自定义驾驭、工具和上下文。开发堆栈则变成你的专有评估、领域数据和在线学习循环。

这确实是更多的工作!这可能给你一个较低的起点——但也会提高上限。

掌控你的智慧:操作指南

实验室将继续构建巨型大脑。我们都应该利用它们。

但与此同时,最优秀的产品公司正在培养自己的小天才:快速、主观、专注于领域,并与他们所看到的工作相契合。在一个越来越多的公司拥有自己智能的世界中,生态系统繁荣,个性得以胜利。

这就是公司拥有智能的世界的承诺。而我们很高兴看到那些想要将这个世界变为现实的小公司、初创企业所取得的进展。

了解 RecodeX 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读