当公开互联网文本被榨干,下一批训练数据从哪里来

2026年秋天,前沿AI实验室的训练数据采购清单正在发生一场静默但剧烈的变化。过去几年,模型能力的跃升很大程度上依赖对公开互联网文本的大规模抓取——网页、代码库、论坛、书籍。但当所有容易获取的语料都已被反复消化,继续增加爬虫规模带来的边际收益急剧下降。模型需要的不再是“更多的文本”,而是更难的推理链、更复杂的工具调用轨迹、更接近真实专家决策过程的评估环境。这些数据无法从公开网页上直接抓取,必须由具备专业判断力的人设计场景、制定评分标准,再借助自动化手段规模化生产。

这正是Snorkel AI试图占据的位置。2026年9月22日,这家总部位于旧金山的公司宣布完成3.5亿美元融资,估值达到35亿美元。据公司披露,本轮由Insight Partners和S32联合领投,现有投资者AdditionGreylock和Wells Fargo参与。公司CEO Alex Ratner对路透社表示,其年化收入运行率已从一年前的大约2000万美元攀升至超过3.5亿美元,增长主要来自2025年9月推出的数据即服务业务。

这笔交易将Snorkel AI的估值推升至2025年5月上一轮1亿美元融资时13亿美元估值的近三倍。16个月内估值从13亿到35亿,背后是一个正在被资本重新定价的赛道:当Meta在2025年6月以143亿美元收购Scale AI 49%股份之后,训练数据供应商从外包服务商变成了战略基础设施,客户和投资者同时开始寻找更多可替代的供应来源。

字段 内容
公司 Snorkel AI
轮次 未披露(Unite.AI称其为Series E,其他来源未确认)
金额 3.5亿美元
投资方 Insight Partners、S32联合领投;Addition、Greylock、Wells Fargo参与
总部 旧金山
创始人 Alex Ratner(联合创始人兼CEO)及斯坦福AI实验室研究团队
官网 https://snorkel.ai/

从卖软件到卖数据:一次被迫的商业模式重构

Snorkel AI的故事起点并不在数据服务,而在软件工具。公司2019年由斯坦福AI实验室研究团队孵化,最初的产品方向是程序化数据标注软件——让用户通过编写标注函数来生成训练数据标签,而不是逐条手工标注。这个方向在学术圈有一定影响力,但在商业上始终没有跑出足够大的规模。直到2025年9月,公司推出数据即服务业务,直接向客户交付成品数据集、强化学习环境和评估数据,收入曲线才开始陡峭上升。

据公司披露,数据即服务业务推出近一年增长超过18倍,年化收入运行率从约2000万美元提升至超过3.5亿美元。以35亿美元估值计算,投资者给出的估值约为年化收入运行率的10倍。这个倍数本身并不极端,但放在16个月前13亿美元估值对应的收入基数上,意味着资本市场对这条转型路径给出了相当激进的确认。

商业模式的核心变化在于计价单位。传统数据标注公司按人力工时或标注条数收费,收入增长与招募和管理更多标注员直接挂钩。Snorkel AI声称其销售的是“数据产品”而非人力服务。据Ratner对路透社的表述,公司接入一个覆盖数万名专家的网络,领域包括编程、法律和医学,专家负责设计场景、任务和评分标准,AI代理和专用模型自动化完成质量保证等劳动密集型环节。公司称这种模式让它可以给专家支付更高报酬,同时保持利润率。但这一利润率的具体水平未披露,专家网络和AI系统的实际成本结构也没有公开数据可验证。

“代理式数据开发平台”到底解决了什么问题

Snorkel AI将其当前产品描述为“代理式数据开发平台”(agentic data development platform)。这个名称的核心含义是:人类专家不再直接生产每一条训练数据,而是定义数据应该长什么样——设计场景、任务、评分标准——然后由数千个专用AI模型和代理来生成和审核数据。人类判断被前置到规则设计和质量把关环节,而非消耗在逐条标注上。

从已披露的信息看,这一架构试图解决的是传统标注模式在复杂任务上的结构性失效。简单的图像分类或文本情感标注可以通过大规模众包完成,但一个涉及多步推理的编程任务、一个需要法律判断的合同条款分析、一个模拟临床决策的强化学习环境,无法被拆解成低技能的重复劳动。这类数据要求生产者本身具备领域专业能力,同时要求质量保证机制能够捕捉细微的错误模式。Snorkel AI的答案是让专家定义“什么是好的数据”,让AI在专家定义的框架内规模化生产。

据公司披露,编程数据是其需求最大的领域之一。这与前沿实验室当前的竞争焦点一致:代码生成、工具调用和专家推理是模型能力竞赛的主战场,而公开代码库中高质量、可验证的复杂推理样本正在变得稀缺。但需要指出的是,Snorkel AI并未披露具体客户名称、合同金额或数据产品的定价方式,其“数万名专家”网络的构成、专业资质分布和实际产出效率均无第三方验证。公司称其服务前沿AI实验室、超大规模云厂商、企业和美国联邦政府,但这些客户关系的深度和持续性无法从公开信息中判断。

Scale AI变局之后:一个被重新定价的市场

理解Snorkel AI这轮融资的估值逻辑,必须回到2025年6月Meta以143亿美元收购Scale AI 49%股份这笔交易。这笔交易的意义不在于金额本身,而在于它改变了训练数据供应商在AI产业链中的位置。在此之前,数据标注被普遍视为AI基础设施中最“低端”的一环——劳动密集、毛利微薄、可替代性强。Meta对Scale AI的战略入股向市场传递了一个信号:高质量训练数据的获取能力,可能成为前沿模型竞争中的战略瓶颈。

这个信号直接触发了两个后果。第一,前沿AI实验室开始主动寻求Scale AI之外的供应商,以避免在关键数据供应上过度依赖单一来源——尤其是当这个来源与Meta存在股权关联时。第二,风险资本重新审视数据赛道,Mercor和Surge AI等竞争对手也在强劲收入增长的支撑下吸引了投资。Snorkel AI此轮融资正是在这个窗口期内完成的。

但竞争格局远未定型。Scale AI在Meta入股后获得了更强的资本和战略背书,其客户基础和交付能力仍然领先。Mercor和Surge AI各自在不同的数据类型和客户群体中建立了据点。Snorkel AI的差异化在于其“数据产品”而非“人力服务”的定位,以及从斯坦福AI实验室延续下来的技术叙事。但这一差异化能否转化为持续的客户留存和定价能力,取决于其数据产品在实际模型训练中是否真的比竞争对手的交付物更有效——这是一个目前没有任何公开基准测试可以验证的问题。

投资逻辑:10倍运行率估值买的是什么

Insight Partners和S32联合领投这轮融资,给出的估值约为年化收入运行率的10倍。S32合伙人Andy Harrison对路透社的表述是:“数据正在变得更稀有、更专业、更难找到。如果你想训练最前沿、最复杂、最有能力的模型,现在你需要更优质的数据。”这句话概括了投资方的核心逻辑:数据稀缺性正在从“量”的稀缺转向“质”的稀缺,而Snorkel AI被定位为高质量数据产品的供应商。

从资本结构看,这轮融资的另一个值得注意的细节是,据MarketScreener披露,公司在本轮交易中发行了可转换优先股。这意味着投资者获得的是带有转换权的优先股权,而非普通股。这种结构在后期高估值轮次中并不罕见,它给投资者提供了下行保护,同时也意味着公司的实际股权成本可能高于表面估值所显示的水平。Snorkel AI未披露本轮融资的具体条款,包括清算优先权、转换比例和反稀释条款,因此35亿美元估值的实际含义需要打一定折扣。

另一个需要审视的问题是收入运行率的可持续性。年化收入运行率从2000万美元到3.5亿美元的增长发生在数据即服务业务推出后的第一年。这个阶段的收入增长通常包含大量一次性项目、新客户获取和早期采用者的集中采购。能否将这批早期客户转化为长期合同,能否在保持数据质量的同时将专家网络和AI系统的成本控制在合理水平,是决定10倍运行率估值是否合理的关键变量。公司称预计今年实现盈利,但这一目标尚未实现,且公司在同一时期计划大幅增加研究人员和工程师的招聘,这意味着成本端仍在扩张。

资金用途:扩张的方向与未回答的问题

据Ratner对路透社的表述,本轮资金将用于四个方向:招聘研究人员和工程师、扩展企业和政府业务、支持第三方AI模型评估、进入更多行业和数据模态。这四个方向中,前两个是常规的扩张动作,后两个则透露出更具体的战略意图。

“支持第三方AI模型评估”意味着Snorkel AI希望从训练数据供应延伸到模型评估环节。这是一个逻辑上连贯的延伸:如果公司已经在为前沿实验室设计测试场景和评分标准,那么将这些能力产品化为独立的评估服务,可以打开一个与训练数据不同的预算池。但评估业务的技术门槛和竞争格局与训练数据不同,现有的模型评估市场已经有专门的参与者和方法论体系,Snorkel AI能否在这个领域建立可信度,目前没有公开证据支持。

“进入更多行业和数据模态”则指向当前业务集中度的风险。公司称编程数据是其最大的需求领域之一,这意味着收入可能过度依赖少数前沿实验室的编程相关项目。向法律、医学、金融等行业扩展,以及向视频、音频、多模态数据延伸,可以降低客户和数据类型集中度,但每个新领域都需要建立对应的专家网络和质量标准,扩张成本不容低估。公司未披露各行业收入占比、客户集中度或合同期限,因此无法判断其收入结构的真实稳健程度。

风险与待验证假设:增长叙事背后的三个未解问题

Snorkel AI的增长叙事建立在三个核心假设之上,每一个都尚未被独立验证。

第一个假设是“数据产品”模式真的比“人力服务”模式拥有更高的毛利和更好的可扩展性。公司声称其销售数据产品而非按人力收费,这使其能够给专家更高报酬同时保持利润率。但从已披露信息看,公司并未公开毛利率、单位经济模型或专家成本占收入的比例。如果AI自动化质量保证的效果不如预期,或者专家网络的管理成本随着规模扩大而超线性增长,那么“数据产品”的利润率优势可能被成本结构侵蚀。这一假设的验证需要公司公开更详细的财务数据,而目前这些数据均未披露。

第二个假设是前沿AI实验室对高质量训练数据的需求会持续增长,且不会因为合成数据技术的进步而减少对人类专家输入的依赖。Ratner的表述是:“我们的强烈观点是,在可预见的未来,实验室能从中获得价值的100%的数据都会有某种人类输入。但100%的数据都必须使用合成和自动化方法来跟上这种复杂性。”这是一个精心构造的表述,它同时承认了合成数据的必要性和人类输入的不可替代性。但从已披露信息看,没有任何独立的行业数据或客户行为证据可以证实“100%的数据都需要人类输入”这一强断言。如果前沿实验室在合成数据技术上取得突破,降低了对人类专家设计场景的依赖,Snorkel AI的核心价值主张将受到直接冲击。

第三个假设是Scale AI变局带来的客户分流效应会持续存在。Meta入股Scale AI确实推动了客户寻找替代供应商,但这种推动力的持续性取决于两个因素:一是Scale AI是否会在Meta的支持下进一步强化其市场地位,二是Snorkel AI能否证明其数据产品在质量上足以替代或超越Scale AI的交付物。目前没有任何公开的基准测试或客户背书可以证明这一点。公司称其服务前沿AI实验室和超大规模云厂商,但未披露任何具体客户名称,这使得“客户分流”的叙事缺乏可验证的锚点。

从已披露的X(收入运行率从2000万美元到3.5亿美元)和Y(数据即服务业务推出近一年增长超18倍)来看,这意味着Snorkel AI在极短时间内完成了从软件公司到数据服务公司的转型,并且获得了至少一部分前沿实验室的实质性采购。但Z——客户名单、合同期限、毛利率、专家网络成本结构——均未披露,因此结论的边界是:增长是真实的,但增长的质量和可持续性无法从公开信息中判断。

验证边界与可复核指标

本文涉及的“首个、唯一、最大、领先”、订单、出货、性能等表述,如无另行说明,均是公司、创始人或投资方在现有公开材料中的披露口径;RecodeX未在本次采集材料中找到独立审计或第三方测试结论,因而不将其视为已经独立确认的事实。文中的产业协同、竞争位置和商业路径属于基于已披露产品与融资用途的编辑分析,不代表相关结果已经实现。

  • 技术侧应核验第三方测试条件、样本规模、良率、稳定性及与可比方案一致口径的结果;
  • 商业侧应核验去重后的付费客户、可执行合同、收入确认、复购率以及订单转化;
  • 资本与产业协同应以工商股权、关联交易、联合开发、采购或量产文件为准。

RecodeX 极客视:Snorkel AI的这轮融资真正的信息量不在35亿美元估值,而在它验证了一个产业判断:前沿AI竞赛的下半场,瓶颈正在从算力和模型架构转向高质量训练数据的工业化生产能力。当公开互联网的“免费午餐”被吃尽,数据从可以抓取的资源变成了需要设计的产品。但“数据产品”这个定位本身还只是一个未经验证的承诺——它的成立需要证明专家判断可以被标准化、AI质检可以规模化、客户愿意为“产品”而非“工时”持续付费。在Scale AI变局打开的窗口期内,Snorkel AI拿到了下注的筹码,但牌桌上的验证才刚刚开始。

信息来源

本文在采集与核验阶段引用了以下公开来源,按站点去重列出;来源内容归原发布方所有,其口径不代表 RecodeX 的核实结论。