本文信息来源:a16z
如果现有企业完全关闭数据阀会怎样?
作为一名与数百家 B2B AI 初创公司打过交道的投资者,我可以自信地说:有一个趋势非常清晰——现代 AI 产品几乎总是依赖于通过 API 访问的既有平台数据——Slack、Salesforce、Zendesk、QuickBooks、Jira、LinkedIn 等。典型的 AI 原生应用需要存储在各类记录系统中的有价值信息来自动化特定工作流程(从而解决“杂乱收件箱问题”)。但当这些平台开始囤积其数据,不再允许获准的第三方访问时,会发生什么?
Salesforce 最近收紧对 Slack 数据的访问是预警信号。截至 2025 年年中,第三方工具不再可以批量索引 Slack 消息。非 Salesforce Marketplace 的应用受到速率限制,且不能长期存储历史数据。这一举措扰乱了基于该基础性访问构建的企业级助手、知识图谱和 AI 代理。
但这不仅仅是针对 Slack!看起来有权限的数据访问正遭到全面围攻。JPMorgan 已经威胁向领先的金融科技账户聚合器收取每年 3 亿美元的数据访问费。微软正在对像 Bing 和 Github 这样的平台施加更严格的控制。其他既有企业很可能会跟进。如果数据访问成为一个封闭的循环系统,会有哪些东西被破坏——又会失去什么?
正如我的合伙人 Seema 最近写道 ,“平台之战才刚刚开始——而且不会在产品层面展开,而会在 API 层面展开。”我同意。虽然 API 访问可能不会被完全切断,但日益增长的限制、设门槛和货币化压力将从根本上重塑初创公司构建、增长和定价其 AI 产品的方式。
为什么这些既有企业要这样做?
这些限制背后的驱动动机通常包括:
- 在日益收紧的监管(如 GDPR、DORA)下,加强数据隐私和合规性
- 保护战略资产并为现有企业推进自身的人工智能和平台雄心铺路
- 通过将竞争对手排除在有价值的平台和数据访问之外来限制市场竞争
从定义上讲,现有企业在客户关系中已经处于主导地位——为何要让被踢到后排变得更容易?
客户会反抗——还是适应?
企业渴望整合。它们已经构建了内部协同助手,接入 Slack、Salesforce 和 Jira 来回答问题、撰写邮件、总结讨论线程并协调事故处理。如果这些通道被切断,生产力会下降,内部团队会手忙脚乱。负责防止数据和决策被孤立的运维团队是成体系存在的。因此我们预计,这类阻断不会不费吹灰之力地发生。
事实是,虽然许多客户在技术上拥有他们的数据,但 incumbents 仍掌控着管道。正如我的合伙人 Alex 常说,“最好的公司(即记录系统)掌握的人质,而不是客户。”然而在大多数情况下,即便是“人质”也不会容忍彻底的 API 封锁。如果他们无法使用心爱的工具,就会反抗。这就是为什么,正如 Seema 所言,“访问会保持开放——但变得更贵。” incumbents 不太可能按下终止开关。他们会通过速率限制、笨拙的沙箱、更高的接入费用、不透明的审查流程以及更严格的市场政策门槛来挤压生态系统。这是一场消耗战式的 API 之争,而非直接撤销。
我们可以参考开放银行的先例。Plaid 的成立旨在让用户安全地将他们的银行账户与知名金融科技应用连接。尽管《多德-弗兰克法案》第 1033 条明确规定消费者有权访问自己的金融数据,许多银行仍试图阻止 Plaid 的访问,最终担心自己会被客户边缘化。但重要的是发生了另一件事:在许多情况下,用户对他们的金融科技应用的忠诚度已经高到,如果银行阻止 Plaid,用户更有可能离开阻止者,而不是放弃那个无法再连接的金融科技应用。
这里有两层含义:1)监管机构或许应更明确地划定客户与软件提供商之间的数据所有权(理想情况下确认客户有权在任何他们想要的地方访问这些数据),2)B2B AI 应用所带来的早期魔力和明显效用,可能会激励用户对任何试图限制访问的既有势力发起强烈反弹。
如果既有势力真的阻止访问,那依赖这些数据的初创公司会怎样?
最容易受影响的初创公司是那些提供统一搜索、企业协同助手、自动摘要和知识图谱聚合的公司——基本上,任何需要从一个或多个记录系统中提取数据以实现其产品承诺的产品。如果你的产品假定有广泛、持续的多平台索引,你的模型可能面临风险。好消息是,有几种选择:
- 倾向于 RPA 2.0——利用电脑绕过 API。模拟人类行为,实际进入记录系统并提取必要数据。固然笨拙,但这是一个可行方案。
- 通过现有平台拥有者运营的市场进行上市推广(尽管这会带来巨大的“税”)
- 转而嵌入企业内部,并按客户逐一协商访问权限。我们预计会看到许多提供咨询式 AI 自动化的供应商。
- 从摄取层重建,帮助客户重新掌控自己的数据。
这些策略没有一个万无一失,但都能在突发的 API 访问变化时提供防护。最直接的风险是什么?利润空间将被压缩。平台费用 + 速率限制 = 单位经济性下降 + 销售周期拉长。
开源机遇:收复数据主权
是的,开源提供了强有力的反向叙事,但它并非灵丹妙药。尽管开源 LLMs(Mistral、LLaMA)、编排框架(LangChain、LlamaIndex)和向量数据库(Pinecone)并不能神奇地授予对既有专有数据的访问权,但它们为企业重新掌控自身数据资产提供了关键机制。
当企业能够将其数据(或部分数据)从专有平台中提取出来时,开源工具使其能够独立处理、存储并利用这些数据。尤其是向量数据库在此发挥关键作用:它们高效存储和索引复杂非结构化数据(如 Slack 的文本或 Salesforce 的文档)的数值表示(嵌入),从而在原有供应商生态之外实现快速、由 AI 驱动的相似性搜索与检索。
这意味着企业可以在自己的数据上构建知识图谱和 AI 助手,部署在自己的基础设施上,使用开源模型,最终摆脱现有供应商的锁定,自主决定数据命运。开源的真正优势在于可移植性:它允许你在数据所在之处部署解决方案,为应对未来可能的数据管控提供重要保障。若没有任何监管行动——比如前述假想的类似《多德-弗兰克》第 1033 条的企业数据规定——开源可能成为企业收回控制权的关键解锁工具。
创业公司会构建完整的技术栈吗?
绝对会。我们已经看到早期信号:
- 像 Databricks、Reducto 和 Pinecone 这样的水平基础设施提供商正在为从数据摄取到推断的管道提供动力。
- 像 Harvey 这样的垂直厂商与合作伙伴紧密集成,按客户工作流程同步定制技术栈和模型。
- 越来越多的公司正成为迷你咨询与 SaaS 的混合体:前端提供服务以获得数据,后台通过产品化层实现规模化。
在一个访问受限的世界里,“全栈人工智能初创公司”不再只是一个说辞,而开始成为最具防御力的市场进入策略。
生态系统中的每个参与者如何为这种潜在的未来做规划?
创始人和初创公司:
- 抽象化你的摄取层:为 API 故障而设计,包含爬虫、嵌入式向量、前置部署代理、计算使用模型和机器人流程自动化(RPA)
- 尽早谈妥合作:加入市场平台、签订数据共享合同、成为嵌入式基础设施。
- 至少掌控数据堆栈的一部分:构建导入工具、在客户防火墙内托管,或转向由客户自带数据的部署。
战略性地采用开源:为防止被锁定,应将贡献或维护数据摄取基础设施作为一种保险措施。
企业软件采购者:
- 掌控你的数据命运:坚持使用你拥有索引的软体。
- 当心原生 AI 锁定:如果一个 LLM 只能看到某个厂商展示给它的内容,它就不是你的协同助手——是他们的。
- 倾向选择提供可移植性的合作伙伴:你能更换基础设施吗?迁移模型吗?保留审计能力吗?
在位者:
- 谨防过度扩张——对接入设置过多门槛的平台可能会减缓创新并引发悄然的客户流失。
- 提供分层访问、透明条款及“数据导出”途径,以避免监管反弹或大规模流失。
- 要意识到,你不再是在与初创公司竞争,而是在与自己生态系统的信任竞争。
结束语
我们正进入一个数据访问成为 AI 最关键战略要素的时代。如果数据被封锁,未来将分化为两个路径:
路径一: 封闭堆栈的既有企业,其 AI 功能平平——但它们掌控着客户的端到端工作流程。真正的人质局面!
路径二: 全栈挑战者,更深入整合、更紧密结合,为客户提供自由、掌控权和更优的结果。
正在构建 B2B 人工智能的创始人现在必须问自己,而不是等到以后:
“如果我今天使用的所有 API 明天都消失,我的业务还能继续吗?”
如果答案是否定的,那就该重建了。因为在接下来的篇章里,数据很可能既是护城河,也是产品,还是杠杆。