原创报道
2026.06.17 23:39 约 6 分钟 AI人工智能 持续阅读

XDOF 完成 7000 万美元融资:当所有人都在追逐机器人大模型,这家公司赌的是一个更脏、更累、但可能更重要的活——给机器人「喂数据」

项目速览
项目名称 XDOF
融资轮次 融资轮
融资金额 7000万美元
投资方 Thrive Capital, Spark Capital, a16z, Lux Capital, WndrCo
官网 xdof.com

在 AI 领域有一条被反复验证的铁律:模型的上限取决于数据的质量和规模。GPT 之所以能理解语言,是因为它吃下了互联网上几乎所有的文本数据;Stable Diffusion 之所以能生成图像,是因为它训练在数十亿张图片上。但当这条铁律延伸到机器人领域时,一个致命的断裂出现了——用来训练机器人的高质量物理交互数据,几乎不存在。

YouTube 视频和零工拍摄的画面分辨率太低、角度不对、标注不全。你不能像爬取网页文本那样「爬取」一个机器人折叠 T 恤的精确动作轨迹。每一条有用的机器人训练数据,都需要真人操作真实的机械臂,在受控环境中一帧一帧地生成。

XDOF(发音「X-DOF」)正在将这个脏活、累活变成一门基础设施生意。这家由三位 UC Berkeley 研究者创办的公司刚刚完成了 7000 万美元的融资,投资方包括 Thrive Capital、Spark Capital、a16z、Lux CapitalWndrCo——几乎是硅谷顶级风投的全明星阵容。

项目 详情
公司名称 XDOF
融资金额 7000万美元
融资轮次 融资轮
领投方 Thrive Capital
跟投方 Spark Capital, a16z, Lux Capital, WndrCo
公司总部 美国
创始人 Philipp Wu (CEO), Fred Shentu (CTO), Nemo Jin (COO)
成立时间 2024年10月
官网 🔗 xdof.com

机器人的「数据荒」:为什么这是比模型更紧迫的瓶颈

理解 XDOF 的价值需要理解机器人 AI 与语言 AI 之间一个根本的结构性差异。

大语言模型(LLM)训练在文本上——互联网上有数万亿单词的文本数据,几乎是「取之不尽」的资源。图像生成模型训练在图像上——LAION 数据集包含了数十亿张带标注的图片。但机器人模型需要的是物理交互数据:一个机械臂如何抓取一个杯子?施加多大的力?从什么角度接近?手指如何合拢?这些数据不存在于互联网上,也无法通过简单的标注获得。

CEO Philipp Wu 在 UC Berkeley 攻读 PhD 时亲身经历了这个「鸡生蛋」问题:「我们想研究如何用大规模数据集训练机器人学习技能,但我们首先需要收集数据,然后才能问如何训练机器人基础模型。」

Wu 和未来的联合创始人 Fred Shentu 在 Berkeley 开发了 GELLO——一种低成本的遥操作系统,让人类操作员可以控制机械臂来生成训练数据。这篇论文在机器人学界产生了巨大影响,因为太多研究者面临同样的数据匮乏问题。

数据金字塔:从遥操作到第一人称视角的三层架构

XDOF 的数据策略不是「用一种方法收集所有数据」,而是构建一个三层金字塔:

最顶层(最高价值):在实际部署的目标机器人上进行遥操作采集的数据。这种数据与最终应用场景完全匹配,每一条都是「黄金数据」。

中间层:使用通用遥操作系统(如 GELLO)在标准机械臂上采集的通用操作数据。这种数据的适用面更广,可以跨机器人平台迁移。

底层(最大规模):由人类佩戴传感器执行日常任务时采集的「第一人称视角」数据。这种数据最容易大规模获取,但需要复杂的算法来将人类动作映射到机器人控制指令上。

Wu 特别强调了硬件设计对数据质量的影响:「你的摄像头选择会影响数据质量,数据质量会影响手部追踪算法的表现。如果你一开始没有把硬件设计好,收集的数据可能会有你无法预见的特定问题。」

与 UC Berkeley 合作发布 ABC 数据集:机器人领域的「ImageNet 时刻」?

作为起步,XDOF 正在与 UC Berkeley 的 AI 研究实验室合作发布 ABC 数据集——他们认为这是有史以来规模最大的高质量机器人训练数据集合。它包含 13 万条机器人操作轨迹、300 小时的仿真数据和 100 小时的真实世界操作数据。

团队已经用这些数据训练机器人完成了折叠 T 恤、压平盒子、将 AirPods 放入充电盒等基准任务。

Berkeley 的 PhD 学生 David McAllister 指出了开放数据的深远意义:「我们在语言、图像生成和其他领域已经看到,当模型和数据被公开发布时,社区能够取得你不一定预料到的成果。」如果 ABC 数据集能够在机器人学界产生类似 ImageNet 在计算机视觉领域的催化效应,那么 XDOF 将从一开始就占据这个数据生态的中心位置。

7000 万美元背后的逻辑:为什么顶级风投全部下注

XDOF 的投资人阵容几乎是一次「硅谷风投共识」的展示。Thrive Capital(Joshua Kushner 的基金,以早期发现平台级机会著称)、a16z(在机器人和 AI 基础设施领域布局最深的风投之一)、Spark Capital、Lux Capital(深科技领域的标杆投资者)和 WndrCo 的集体参与,说明顶级投资人已经达成了一个判断:机器人数据基础设施将成为机器人 AI 时代的关键瓶颈和关键机会。

XDOF 计划在全球范围内招聘和培训大量的遥操作员和数据采集人员——这是一个高度劳动密集型的模式。Wu 解释了为什么顶级 AI 实验室不自己做这件事:「你需要数十万平方英尺的仓库,里面放几百台机器人。你需要维护这些机器人、校准它们的物理参数、并且正确培训操作员。」这种规模化运营需要的专注度、资本和运营能力,是大多数 AI 实验室宁愿外包的。

RecodeX 极客视点:XDOF 押注的是机器人 AI 领域一个被严重低估的瓶颈——数据。在语言 AI 时代,数据标注公司(如 Scale AI)成长为了价值数十亿美元的企业,因为它们解决了 AI 实验室最不想自己做、但又不可或缺的环节。XDOF 显然在追求机器人领域的同一叙事。7000 万美元的融资规模和 Thrive + a16z + Spark + Lux 的投资人阵容,是对这个叙事的最强力背书。但机器人数据生意面临的挑战也比语言数据标注更大:物理数据的采集需要真实硬件、真实空间和真人操作,边际成本远高于文本标注。XDOF 的成败将取决于它能否在「数据质量」和「规模化效率」之间找到甜蜜点——如果数据太廉价,质量会下降到无用;如果质量要求太高,成本会让客户望而却步。ABC 数据集与 Berkeley 的合作是一步精妙的棋——通过开放数据建立行业标准和社区信任,然后在此基础上销售商业级数据服务。

分类与标签

分类: AI

标签: AI 机器人 机器人数据 训练数据 深科技 a16z 美国创业

信息来源

订阅 RecodeX 创投情报 每日融资动态与原创深度报道,直达邮箱
RECODEX PARTNERSHIP
你的项目,下一篇值得报道
RecodeX 为 AI×Web3 早期项目提供从深度报道到融资撮合的全链路服务。三档方案,按阶段匹配。