本文信息来源:foundationcapital

当模型提供商吞噬一切:面向“服务即软件”创业公司的生存指南

[audio mp3="https://recodex.ai/wp-content/uploads/2025/08/AI应用创业者生存指南:大模型夹击下,如何用反馈闭环和智能体构建护城河?.mp3"][/audio]

OpenAIAnthropic 这样的基础模型提供商不再仅仅出售 API 接入。在过去一年里,我们看到这些公司积极向上游扩展,从基础设施提供者演变为真正的产品公司。如果你的创业公司通过使用他们的某款模型取得成功,很有可能该提供商会直接将这些功能并入自己的产品或推出竞争应用。

换句话说,支撑你业务的模型提供商也可能转身碾压你。

威胁并非空谈。由于大型模型实验室构成了无数 AI 应用的底层支撑,它们对整个 AI 生态中哪些做法有效有着全景式的观察。它们能看到哪些领域推动了大量的 API 使用、哪些新应用正在获得关注、以及哪些提示和功能能带来最佳效果。掌握这些信息后,它们可以迅速锁定有前景的用例,并将其直接纳入自家产品。早期阶段,快速成长的初创公司有时会获得模型提供方的“特殊待遇”(如优先的 API 条款或提前访问新功能),但随后却可能面临该提供方成为竞争对手或收购方的局面(如近期的 Windsurf 事件)。

那么,当你依赖的平台可能会变成你的竞争对手时,如何打造一家持久的应用层 AI 初创公司? 到目前为止的共识是,你应该将产品架构设计为:底层模型的每一次改进都成为顺风而非阻力。实际上,这意味着如果 OpenAI 发布了更强大的模型或新功能,应当让你的产品变得更好,而不是变得无关紧要。这是一条很好的原则——但要真正做到却比说起来难得多。

在过去几个月里,我们着手回答这个问题。我们与数十位 AI 创始人交谈,旁听董事会会议,并与我们的投资组合公司紧密合作,弄清哪些因素能让 AI 初创企业更具抗风险能力。在这些对话中出现了若干共同线索。简言之,最具前瞻性的团队在系统层面思考:他们正在构建能够从现实世界交互中持续学习的 AI 代理,这种能力是大型实验室难以轻易复制的。

在本文的其余部分,我们将探讨能够使应用层 AI 初创公司具有防御性的策略。首先,我们将回顾过去三年里 AI 软件格局如何演进,直至我们当前由强化学习(RL)驱动的 AI 代理时代。接着,我们将描述具体策略(并以我们投资组合中的初创公司为例)——这些策略如何帮助应用层 AI 初创公司将模型提供商带来的威胁转化为顺风。

AI 应用的三波浪潮

自 ChatGPT 发布以来,我们已经看到三波截然不同的应用层 AI 初创公司浪潮,每一波都伴随更激烈的竞争和整合:

第一波(2022 年):包装器时代。 这些是简单的产品:几个巧妙的提示词或策略置于直观的用户界面之后,全部建立在基础模型的 API 之上。这些“包装器”容易构建,但同样容易被复制。且一旦底层模型改进,许多此类应用提供的功能被模型本身吸收,或变得他人容易复制的琐碎功能。

第二波(2023–2024 年):AI 原生时代。 第二波 AI 创业公司尝试更真正地“AI 原生”。这些团队从第一性原理出发:围绕 LLMs 的独特能力设计产品,构建定制数据管道以增强模型输出,并将 AI 紧密嵌入用户工作流程。但随着模型提供商向上层堆栈延伸——推出自己的应用、更改 API 条款、构建竞争产品——这些初创公司发现自己处于岌岌可危的境地。许多公司被它们所依赖的平台挤压。

第三波(2025):具代理性的时代。 在当前的具代理性人工智能浪潮中,新一代推理模型和后训练技术进一步模糊了人工智能基础设施与终端用户应用之间的界限。模型提供商正在向用户直接推出具代理性的产品(例如 OpenAI 的 Agent Mode 和 Anthropic 的 Claude Code)。对于初创公司来说,这意味着“原生 AI”的门槛进一步提高:仅仅利用强大的模型已不足够,你必须构建一个能够随着时间学习、适应并改进的系统。

强化学习日益重要

在第三波浪潮中, 强化学习已崛起 ,成为构建将 AI 作为自主工作者而非仅仅作为副驾驶的模型和应用的核心要素。这正在改变 AI 的竞争格局——可能有利于初创公司。

在生成式人工智能的早期,许多人认为现有巨头(Google、Meta、Microsoft 等)必然会胜出,因为他们“掌握数据”。但随着 AI 能力的提升,他们那堆积的历史数据变得不再那么决定性。在一个具备代理能力的世界里,杠杆力最大的资产不是遗留的数据集,而是与真实用户在真实工作流程中的反馈回路。

巨头或许掌控着其 SaaS 应用内的大量数据,但他们看不到产品之间发生的事情:决策、交接以及真实用户在任何单一界面之外采用的多工具流程。初创公司可以切入这些空白。通过与多个工具集成并观察端到端流程,他们可以收集关于跨系统实际工作如何完成的数据。

例如,考虑一个 AI 销售代理。一个基础的销售 AI 助手可能会自动化某些单独任务,比如记录 CRM 条目或发送模板化邮件。这作为生产力提升是有用的,但这些收益仅是边际性的。

现在设想一个由强化学习驱动的销售代理,它通过观看从潜在客户开发到成交的整个过程来主动学习销售技巧。随着时间推移,它开始捕捉能促成成交的模式。也许它会学到,在演示后两天跟进的效果比在一天后跟进更好,或者某个行业的交易通常需要在方案阶段引入销售工程师。最终,这样的代理不仅会为你起草邮件——它会提醒你何时发送、建议应邀请哪些人参与,并选择最有效的沟通渠道。本质上,该代理正通过观察顶级销售人员的行为和结果,学习他们未写入手册的惯用做法——这些内容在静态的 CRM 字段中是找不到的。

构建这种具有长期视角和交互性的智能系统并不容易。这既需要在人工智能研究上出现新方法,也需要在工程实现上有新进展。各大模型实验室(OpenAI、Anthropic、DeepMind 等)正在大举投入以攻克这一难题。与此同时,一波新的初创企业也在涌现,提供“强化学习即服务”(RL-as-a-service)工具。(我们的投资组合公司 Turing,例如,是最早向领先的 AI 实验室提供“强化学习训练场”的公司之一。)

几项关键要素包括:

  • 评估器: 评估器是任何判断 AI 代理输出或行为质量的机制。这在没有单一正确答案的模糊领域尤为重要。评估器可以有多种形式——可能是评分细则、检查清单,或作为批评者的另一个 AI 模型。它的任务是提供反馈或分数,反映代理的表现有多好。 OpenAI 正在为此开发一个“ 通用验证器 ”。据报道,这一过程使用一个 AI 模型逐步检查和评分另一个模型的输出,通过将事实和逻辑与各种来源交叉核对来进行。在实践中,这意味着即便是像创意写作或高等数学证明这样主观性的任务,也可以对模型的回答进行质量和正确性的评分。OpenAI 将其归功于帮助其一款模型在国际数学奥林匹克中获得金牌——这是此前 AI 从未达到的成就。
  • 奖励管道: 奖励管道将所有评估者得分和其他反馈信号转化为强化学习算法所优化的奖励值。实际上,这意味着要将各种反馈汇总并加以权重,形成一个单一的数值(例如可能会优先考虑事实准确性而非风格),以便代理优化的是整体质量,而不仅仅是某一项指标。一个好的奖励管道还要处理具有许多决策点的长时程任务。复杂的多步骤任务在达成结果之前可能涉及数百个动作,代理不能等到最后才获得学习信号。奖励管道通过将功劳(或责任)归因于中间动作来解决这一问题——要么在关键步骤提供反馈,要么将最终结果回溯传播到早期决策(这就是强化学习中的经典归因问题)。
  • 自定义训练环境 :这些是模拟的软件环境——可以想象成一个被沙箱隔离的 Salesforce 实例、一个类似 DoorDash 的虚假物流仪表盘,或一个用于通用网页任务的模拟网络浏览器。此类环境让 AI 代理可以安全地进行试验:它可以尝试各种操作、观察结果,并在不影响真实用户或数据的情况下学习长期策略。值得注意的是,OpenAI 和 Anthropic 正在积极地在前 150 大网站的模拟版本以及所有主要记录系统中训练代理。他们的目标不是将这些环境作为产品授权,而是将其作为模型的训练场。如果某个模型掌握了这些沙箱模拟,它就能获得性能优势,并能作为一个从第一天就理解真实软件工作流程的代理被部署。
  • 针对稀疏和延迟反馈的强化学习专用基础设施 :许多有价值的任务(例如调试复杂系统或促成企业销售成交)往往要在长时间步骤序列之后才能见效——有时要几分钟、几小时甚至几天。反馈的延迟使得 AI 代理难以学习,因为反馈稀少且在影响它的行为发生很久之后才到达。在这些条件下训练智能体需要专门的强化学习基础设施。例子包括回放缓冲区(让智能体记住并从过去的经验中学习)、异步展开(并行运行多个智能体实例以更快收集训练数据)以及先进的信用分配技术(确定哪些先前的行动对最终的成功或失败负责)。

对强化学习的所有这些投入不仅仅是为了构建更好的智能体:更重要的是掌握学习闭环。由用户与智能体协同产生的交互数据流正成为 AI 的关键专有资产。谁能捕捉到这一闭环——谁的界面在收集那些点击、决策和结果——谁就能建立起复利式的优势。

如何构建有防御力的应用层 AI 初创公司

那么这对应用端的 AI 创业者意味着什么?在实际操作中,如今要打造一个持久的 AI 应用型创业公司,就要专注于那些你能掌控最有价值数据和反馈闭环的领域。理想情况下,你的 AI 代理应当嵌入到以判断为主的工作流程和具有客户特定性的流程中,从而产生大型模型提供方难以观察或复制的交互数据。

这通常意味着要承担那些依赖人工判断、定性信号和上下文的棘手任务。无论某项任务的“成功”是容易衡量的(比如一项索赔是否正确提交)还是更主观的(比如一份分析是否足够有见地以促使首席财务官采取行动),关键在于你要定义成功的标准并捕捉这些信号。通过掌控你领域内的数据、结果和成功定义,你就能创建一个不断改进产品的反馈闭环。

以下是我们在把这件事做对的应用层 AI 初创公司中观察到的五种模式。

⚠️ 策略一:精通高例外情形工作流

许多企业流程充斥着边缘情况、例外和不断变化的规则。模型提供商很难应对跨行业的所有这种多样性,但专注的初创公司可以将这种复杂性转化为优势。

以保险行业为例:理赔处理流程会根据保单类型、司法管辖区和新规而大相径庭。没有任何现成的 AI 模型能自动掌握如何应对每一种组合。

我们的投资组合公司之一,Fulcrum,意识到了这一点,并为棘手场景将人类纳入其 AI 代理平台的闭环。每当 Fulcrum 的保险处理 AI 遇到含糊不清或超出其置信区间的情形时,它就会标记由人工理赔师介入。AI 并不会在罕见的边缘案例中乱闯,而是将决策交给人——更关键的是,它从专家处理该情形的方式中学习。随着时间推移,代理会积累这些例外情况及其合适解决方案的知识库。通过一开始就在工作流中内置专家干预,Fulcrum 将现实世界的复杂性转化为训练资产。

🔄 策略二:在模糊领域创建专有反馈回路

在事实难以界定或带有主观性的领域,大型模型提供商难以有效训练。那些将自己嵌入这些高度模糊环境的初创公司可以利用这种模糊性为己所用。它们开发定制的评估器、评分标准和奖励函数,以在特定问题空间内定义成功,为其代理提供现成模型中不存在的学习信号。

PlayerZero 是一个很好的例子。他们的代码代理能够跨代码库、工单、遥测和架构图进行推理,从失败与解决的模式中学习,随着时间推移提升其性能。关键在于,PlayerZero 不依赖静态数据集进行训练:它持续摄取新的事件数据,进行分析,并更新其关于分布式系统行为的内部模型。这形成了一个良性循环,代理每处理一次异常就变得更智能。PlayerZero 能从真实世界的行为中学习,即使成功标准模糊或依赖上下文,也使他们在软件可观测性和基础设施故障排查方面拥有持久且不断累积的优势。

我们也看到过类似做法的 Traversal,该公司专注于实时事件响应。他们捕捉并记录代理在事件期间的每一个动作,对结果进行标注,追溯根本原因,并将这些洞见反馈到他们的模型中。通过这样做,Traversal 将每一次失败(或险些发生的情况)都变成系统改进的机会。这一定制化循环以一种通用模型无法比拟的方式磨练他们的代理。

⚙️ 策略 3:掌控执行层

防御力也可以来自于掌控那些大型模型提供商不愿触及的、混乱且难以到达的技术栈部分。企业技术充斥着遗留软件、文档不全的 API、孤立的机构性知识以及笨拙的手动工作流程。在这里茁壮成长的初创公司正是拥抱这种混乱。它们构建能够接入业务流程“胶带层”的代理,在那里脆弱的脚本和人工变通一直是常态。

例如,Maximor 针对那些围绕僵化 ERP 系统运转的影子流程:电子表格、桌面操作流程、非官方的标准操作文件以及员工为在主软件之外完成工作而采用的其他权宜之计。他们的 AI 审计工具会详细观察这些行为,并生成反映实际工作方式的代理操作手册(而非企业想象中的工作方式)。随后,Maximor 与用户紧密合作,将这些操作手册转化为能够在各自组织支离破碎的技术栈中运行的 AI 代理。

另一支团队 Optimized(目前处于隐秘阶段)采用了类似的策略,全面掌控 DocuSign 工作流的执行层面。由于他们管理底层数据记录,并且确切知道需要哪些模板、字段和签署方,他们的代理只需一个简短的提示就能端到端完成合同流程。与其他依赖大量提示并通过多个 API 交互的解决方案不同,Optimized 的产品提供了一键式体验。

统一的教训是:可防御性存在于那些大型模型提供商不屑于拥有的技术堆栈部分。表面领域越是晦涩、痛苦或行业特定,就越有可能成为愿意承担它的初创企业的护城河。

👥 策略 4:招聘领域专家并深入客户一线

我们还观察到另一个模式:打造强大的 AI 应用通常需要深入的领域理解并与终端用户紧密协作。换言之,仅有出色的 AI 研究人员还不够:你还需要真正了解客户世界的团队成员,并在构建过程中与这些客户并肩工作。

我们的投资组合公司 Regie,正在为销售和市场团队开发 AI 代理,就是一个典型例子。他们围绕 GTM(市场推广)专业知识构建了整个组织。公司内有几位高管曾任职于销售参与和营销自动化领域:这些人亲历过 Regie 产品现在所要解决的痛点。

除了聘请领域专家外,Regie 将其工程师和产品团队嵌入客户团队。他们与销售开发代表(SDR)、客户经理(AE)和收入运营(RevOps)并肩工作,直接观察销售流程如何运作以及在哪里出现问题。这样一来,Regie 能捕捉到边缘情形下的销售逻辑细节:销售人员实际说什么、RevOps 如何看待理想客户画像(ICP)评分、外展序列在哪些环节失效。他们还以精确的市场进入(GTM)指标来定义其代理的奖励函数,例如按渠道计算的每位销售人员转化数(而非“发送邮件”之类的通用指标)。这意味着他们的产品针对真正为客户带来业务影响的因素进行了优化。

🏃 策略五:快速并关注细节

速度一直是初创公司的优势,而人工智能将其变成了超级力量。原本需要数个季度才能完成的功能现在可在数周内上线,曾经需要数年才能达到的产品-市场匹配如今可能在数月内实现。每提前一天发布,就意味着能收集到更多用户数据、触发更多反馈回路,并推动模型更快改进。

然而,快速并不意味着在理解问题上走捷径。事实上,当你构建用于复制复杂工作流的 AI 系统时,保持对细节的关注——贴近实际工作和用户——至关重要。要在异常频发的环境中创造高性能代理,你必须深入细节:进行一手研究、梳理出所有边缘情况,并将每一个痛点内化到你要自动化的流程中。许多在这方面取得成功的创始人,往往是曾经的个人贡献者,他们对代理所自动化的工作有第一手的理解。

前进的道路

在所有这些策略中,共同点是比任何人更深入地嵌入你所选择的问题领域。最具韧性的 AI 初创公司正围绕其 AI 构建整套系统,配备领域专属的数据流、自定义反馈回路以及参与其中的人类专家。

关键在于以系统思维来考虑问题。如果你能捕捉到其他人看不到的数据,从每一次互动中学习,并将你的人工智能打造成在你所在领域的细微差别上表现卓越,那么你就无需担心 OpenAI 或 Anthropic 的下一次突破——你会为其喝彩,因为那只会让你的产品更强大。