2026 年的机器人产业陷入了一种结构性荒诞:一边是工厂端对通用人形机器人的渴求催生了仅中国就有 140 家制造商;另一边,这些机器人在离开舞台聚光灯和精心编排的演示视频后,可靠完成真实世界操作仍面临巨大挑战,瓶颈不在电机扭矩、关节自由度或电池能量密度,而在于一个更根本的贫瘠——它们缺少在真实物理世界中与物体交互的训练数据。互联网上的文本即将被大语言模型穷尽,但没有人能爬取到海量人类双手操纵工具的力反馈序列。
一家成立于2024年10月的公司,正试图用一笔大额融资和多层数据捕获体系来填补这一空白。2026 年 6 月,机器人数据基础设施公司 XDOF 宣布完成 7000 万美元融资,投资方包括 Thrive Capital、Spark Capital、Andreessen Horowitz、Lux Capital 和 WndrCo。该公司为 AI 实验室和机器人企业提供物理交互数据的采集管线、标注工具和定制化数据集服务,其核心主张听起来直白得近乎粗暴:成为物理 AI 的数据层。
在产业界仍在为人形机器人的外形设计、灵巧手关节和成本曲线争论不休时,这笔交易悄悄指向了一个更隐蔽的产业链位置——大规模、可重复、经过清洗的机器人训练数据,可能才是决定谁能率先将机器人送入真实工作场景的少数变量之一。
| 字段 | 内容 |
|---|---|
| 公司 | XDOF |
| 轮次 | 未披露(InforCapital 标注为 Series A) |
| 金额 | 7000 万美元 |
| 投资方 | Thrive Capital、Spark Capital、Andreessen Horowitz、Lux Capital、WndrCo |
| 总部 | 美国加利福尼亚州伯克利 |
| 创始人 | Philipp Wu、Fred Shentu、Nemo Jin |
| 官网 | https://www.xdof.ai/ |
一堆互联网语料无法替代的尴尬:为什么机器人数据问题不能用“更大规模的抓取”解决
将大语言模型的训练逻辑平移至机器人领域的尝试正在遭遇根本性挫折。语言数据天然具有可数字化传输、位置无关、边际采集成本趋近于零的特性,而物理交互数据本质上要求一个实体在特定空间内与另一个实体发生接触。一次双手拧紧阀门的操作序列,包含着六轴力矩、指尖触觉、视觉伺服频率、腕部柔顺控制参数、操作对象的几何偏差反馈,以及失败后的恢复路径。这些数据在互联网上几乎不存在——不是因为爬虫基础设施不够好,而是因为它们从未被系统性地记录过。
XDOF 的创始人 Philipp Wu 在 UC 伯克利攻读博士学位期间直接遭遇了这场匮乏。他与另一位联合创始人 Fred Shentu 曾参与 GELLO 项目,一个低成本遥操作系统,让人类操作员通过主手设备远程控制机器人手臂、生成可复用的运动数据。这套系统的开源版本已被多家机器人实验室采用,但其本质局限也暴露无遗:实验室级别的数据采集工作在规模、一致性和工程化程度上远无法支撑通用机器人模型的训练需求。在 GELLO 的工作之后,Wu 和 Shentu 选择向前迈一步——从为研究者提供采集工具,转变为一整个数据生态的构建者。
同样的困境正在产业层面同步放大。2025 年全球人形机器人出货量同比增长 800%,仅中国就有 140 家制造商涌入赛道。1X、Figure、Agility Robotics 和波士顿动力都在投入资源解决同一问题,但各自独立建设数据采集设施的性价比正在迅速下降。机器人训练数据需要在多样化的家庭、工厂、仓库和户外环境中持续获取,而这种基础设施的资本密度和运营复杂度远超任何一个单一机器人公司能够或愿意独立承担的规模。XDOF 的出现本身就是对这一结构性矛盾的资本回应。
GELLO 的工业级延展:一个从社区工具演化为付费管线的三层捕获系统
XDOF 的产品架构并非另起炉灶,而是对 GELLO 技术栈的产业化重构,形成三层递进的数据捕获与加工体系。最底层是摄取与处理基础设施,承接生产量级的物理交互录制。中间层是硬件和软件联合的采集系统,负责抓取机器人操作数据,包括自我中心视频和遥操作序列。最顶层是标注与清洗工具,将原始录制转化为可直接用于训练的数据集。
三层架构中,最值得关注的并非技术参数,而是数据类型的定义方式。XDOF 雇用了两种人类数据生成者:遥操作员,通过主手设备远程控制机器人执行操作动作,输出末端执行器的位姿轨迹和力控参数;以及自我中心数据操作员,穿戴传感器背心奔赴厨房、车间、仓库等真实环境,从人类第一视角记录物理交互过程。后者产生的数据并不绑定于特定机器人硬件,因而被视为更具泛化潜力的“通用交互表征”。这正是机器人基础模型当前最渴望的训练养分——不同于从互联网视频中推断动作效果的不可靠办法,物理数据嵌入了正确的因果结构和动力学约束。
需要注意的是,这种数据类型的定义本身就是对机器人模型训练复杂性的一个注脚。纯视觉数据容易大举采集却难以可靠转化为关节级控制指令;纯硬件绑定遥操作数据精度高但泛化性弱。XDOF 试图通过同时提供两类数据,并建立标准化清洗和标注流程,来解决从数据到模型的“最后一英里”难题。然而这也意味着其产品价值很大程度上依赖于标注管线能否比客户自建方案提供显著的成本和时间优势。这是一项尚待规模化验证的假设。
不保证竞争优势的开放:ABC-130K 数据集的真实角色是商业可行性证明
在公布融资的同时,XDOF 与 UC 伯克利合作发布了 ABC-130K 数据集,包含 13 万条双手操作轨迹、300 小时模拟数据和 100 小时评估记录。公司将之描述为“世界上最大的开源双手机器人操作数据集”。参与合作的机构延伸至卡内基梅隆大学、麻省理工学院和亚马逊,共同发布了该数据集。
但开源不等于护城河,这一判断在事实上毋庸置疑。XDOF 并非在向开源社区捐赠核心资产,而是在用公开数据集向潜在客户发送信号:团队具备大规模数据采集、清洗和标准化能力,能够在可预期的周期内交付可用的、跨机器人平台的操作数据。ABC-130K 的本质是一种企业级销售材料,其面向的读者是前沿 AI 实验室中手握采购预算的工程负责人,而非仅为学术引用的研究者。毕竟,如果一个客户只需要公开数据就能完成模型训练,那么 XDOF 的商业价值确实值得怀疑。公司的实际产品应该是付费客户专享的定制化数据集,这些数据在环境类型、交互对象、任务复杂度和机器人平台上与 ABC-130K 的差异化程度,将直接决定 XDOF 的收入天花板。而这一部分的具体交付时间、客户留存率和合同金额目前均未披露。
此外,数据集合作方中包含亚马逊这一点值得推敲。亚马逊是全球电商和物流自动化巨头,既是潜在客户也可能是潜在竞争者。XDOF 与这类巨头的合作关系走向,将标志着其能否将数据集发布转化为持续性商业合同的变量。
在 Scale AI 的影子下卖铲子,但铲子必须放在物理世界里
XDOF 的商业叙事自然地被类比为“机器人领域的 Scale AI”。Scale AI 在大语言模型和计算机视觉浪潮中通过提供工业级数据标注平台,成为数据标注领域的隐形冠军,其崛起逻辑的基石是文本和图像数据的标注工作完全可以在线完成,熟练标注员可以在任何有网络覆盖的区域提供服务。这一成本结构从根本上决定了 Scale AI 的轻资产属性和高扩展性。
XDOF 面临的是截然不同的成本方程。遥操作员需要通过低延迟主手设备实时控制机器人执行任务,自我中心数据操作员需要进入仓储、家庭或医疗等特定物理场所采集交互数据。场地租赁、硬件折旧、人员物理到场等硬性成本构成了一道 Scale AI 从未遭遇的规模不经济曲线。当前 60 名员工的团队规模和 20 家客户的早期渗透,尚不能验证此业务能否在团队规模扩大、跨洲部署数据采集中心后继续保持经济可行性。
商业模式上,XDOF 未被披露的信息远多于已披露的。公司向 AI 实验室和机器人公司销售数据基础设施和标注服务,但定价模式、合同结构、客户留存率、数据产权的归属条款、是否与客户模型改进效果绑定收费等关键变量均未公开。已知的 20 家客户中包含“若干前沿 AI 实验室”,但没有任何具体名称被提及。这种信息披露策略在一定程度上保护了客户在机器人竞赛中的战术隐私,但也使得外界无法评估 XDOF 营收的客户集中度风险——如果收入集中在少数几家正同时建立内部数据团队的大型实验室,那么这项生意的可持续性就需要重估。
产业链上游位置的资本红利:为什么五家顶级机构现在要赌数据层
本轮的投资者阵容值得解构。Thrive Capital 和 Andreessen Horowitz 已在物理 AI 领域有所布局,无论是通过直接投资机器人公司抑或投资核心组件供应商,增持数据基础设施层使二者在同一个赛道上形成了跨环节对冲——无论最终是 Figure 胜出还是 1X 胜出,训练数据的采购需求都会流向数据提供商。Lux Capital 长期下注硬科学驱动的创业公司,其参与强化了这轮融资的产业链属性而非单一技术赌注。
WndrCo 的进入提供了另一条解读线。作为 Jeffrey Katzenberg 执掌的投资实体,WndrCo 传统上聚焦媒体与娱乐领域。其对 XDOF 的参与可能暗示遥操作数据在工业操纵之外的价值节点——角色动画、电影级机器人运镜、虚拟摄制中演员动作向数字替身的精确映射,这些领域对高精度、可控、可复用的运动数据的需求同样在增长。如果 XDOF 能将其遥操作管线应用于非工业场景,其总可服务市场将显著扩大。
但这仍然是推测。公开信息中没有任何证据表明 XDOF 已与影视或娱乐客户签订商业合同,上述逻辑仅基于投资者身份作出的推断。
用 7000 万美元解决的问题几乎全部与运营有关
资金用途在各项公开材料中被清晰指向四个方向:全球数据采集基础设施建设、数据管线和采集工具开发、标注系统的工程投入,以及遥操作员和自我中心数据操作员的招聘和培训。这种分配方案说明 XDOF 当前的首要瓶颈并非技术架构,而是运营规模。公司需要在不同国家和地区设立可以容纳多种机器人硬件平台的采集中心,招募并训练不同任务类型的数据生成人员,并确保数据质量控制系统能在大规模并行操作下保持一致性。
此项投资的逻辑也隐含着行业整体对基础设施建设的偏好正在超过模型本身。《Stack Futures》的报道对此给出了典型的投资人叙事:在 2025 年全球人形机器人出货量激增 800%,中国聚集 140 家制造商的背景下,对数据的需求与对机器人本体的需求不是先后关系而是同步发生的。这笔 7000 万美元的赌注本质上是在押注一个供给刚性的供应链环节——无论下游玩家如何洗牌,上游数据采集与标注的产能缺口都会持续存在。
然而,这一推理成立的前提是 XDOF 能首先证明其数据产出能在时效、成本和任务适配性上全面碾压机器人公司内部自建团队。而当前没有任何公开指标能从客户留存率、合同续约率或单位经济效益的角度支撑这一论点。
当“数据基础设施”本身又需要基础设施:三条待验证的假设
XDOF 的故事线高度依赖三个核心商业假设,而其中每一个都需要时间和后续季度的运营数据来证明或证伪。
第一,关于客户自制与外包的平衡点。大型 AI 实验室拥有充足的资本和人才密度,可以建设内部数据采集线。对于这些客户,XDOF 只有在交付速度、数据多样性和单位成本上提供显著优势才能成为持续供应商,而不仅仅是早期试用的实验对象。如果内部团队能够在一年内将数据采集业务追平外包水平,XDOF 就将面临类似于云计算早期托管数据中心与 AWS 崛起之间的租户流失风险。
第二,关于物理数据的飞轮效应是否存在。文本数据的网络效应体现在爬虫持续抓取新增网页即能改进模型性能;而机器人数据的困难在于,每当你引入一个新的任务类别或硬件平台,数据获取几乎需要从零开始设置物理场景。这使得数据量的积累未必带来类似语言模型那般顺畅的边际性能提升。XDOF 是否能建立足够标准化的数据格式和采集协议,使得跨任务、跨硬件、跨环境的数据具有可复用价值,是决定其能否获利的变量之一。
第三,关于开放数据与付费路径的可持续性。ABC-130K 的发布已经为研究社区提供了开源的初始启动材料。XDOF 需要通过接下来 12 到 18 个月的商业交付证明,专有数据集相较于开放基准存在可量化的模型性能增量,从而说服客户持续为之付费。如果没有这一差异化的实证,公司就可能滑入开源项目维护者的角色,商业定位将遭到侵蚀。
同时不应回避的一个底层成本问题是:遥操作和自我中心数据采集的人力密集属性意味着 XDOF 即使在技术上建立了自动化管线,其边际成本也无法降到纯软件平台的曲线。7000 万美元融资在当前利率环境下是一笔昂贵资本,公司必须在有限的烧钱周期内达到足以支撑下一轮融资或正向现金流的运营规模。此轮融资的成功反而强调了接下来执行的紧迫感。
RecodeX 极客视:XDOF 将资金投向了一个产业界集体回避的“脏活”——为机器人提供大规模、可重复、经过清洗的物理交互训练数据。这场赌局的核心逻辑并非机器人会越来越多,而是机器人公司会越来越不愿意在数据采集基础设施上自建重资产。然而该公司从 20 家客户的尝鲜阶段跨越为全行业默认数据层之前,仍需要穿越一条漫长的验证走廊:证明其数据的边际成本可以低于任何单一客户自研水平,证明开放数据集不会削弱其商业定价权,以及证明雇员规模扩张不会击穿当前尚未披露的单位经济模型。在物理 AI 的叙事还在等待第一个真正意义上的规模化商业落地案例出现时,卖铲子的人可能比造机器人的人更早触及产业的骨感现实。
