Axis Robotics完成1200万美元种子轮:物理AI的数据瓶颈如何突破?
如果说语言模型的爆发得益于互联网二十年积累的文本,那物理 AI 的尴尬恰恰在于,现实世界从未被数字化过。一个基础的语言任务只需要抓取网页,而一个基础的操作任务——比如让机器人学会打开一扇从未见过的门——需要的是大量的真实力反馈、关节角度和环境交互数据。这些数据不仅昂贵,而且极度稀缺。当业界还在争论模型架构时,一个更底层的瓶颈已经浮出水面:谁能率先建成物理世界的数据管道,谁就握住了通用机器人智能的入场券。
这正是 Axis Robotics 试图站上的位置。2025 年 7 月 27 日,这家专注于物理 AI 数据基础设施的公司宣布完成 1200 万美元种子轮融资,由 Hack VC 领投,Nomad Capital、Pi Network、10K Ventures 及多位天使投资人跟投。这轮融资释放了一个清晰的信号:资本正在从模型层向下渗透,重注那些解决数据稀缺问题的基础设施玩家。
Axis Robotics 选择的切入点是构建一个“复合数据引擎”,将数据生成、采集、训练和迭代整合到同一平台。这一思路的背后是一个朴素的行业共识——当机器人需要在千变万化的物理环境中执行任务时,决定性能上限的往往不是模型本身,而是训练数据的规模、多样性和质量。Axis Robotics 创始人 Chris Feng 的判断更为直白:“物理 AI 的竞争力,与其说取决于模型,不如说取决于数据能以多快的速度积累和改进。”
| 公司 | 轮次 | 金额 | 投资方 | 总部 | 创始人 | 官网 |
|---|---|---|---|---|---|---|
| Axis Robotics | 种子轮 | 1200 万美元 | Hack VC(领投)、Nomad Capital、Pi Network、10K Ventures、多位天使投资人 | 未披露 | Chris Feng | 未披露 |
物理 AI 的集体困境:有钱造机器人,没地方找数据
理解 Axis Robotics 的价值主张,需要先看清物理 AI 面临的数据困境。与语言模型不同,机器人无法从公开互联网大规模抓取训练数据。每一个有效的训练样本——比如用机械臂拿起一个易碎的玻璃杯——都需要在真实物理环境中,通过精确的传感器完成数据采集和标注。这一过程的成本极其高昂,且受限于具体的机器人硬件、工作场景和任务类型。
这导致了一个结构性矛盾:训练数据的获取成本居高不下,可能成为制约整个行业从实验室走向商业化的关键瓶颈。
这正是 Axis Robotics 试图用众包逻辑破解的难题。公司通过一个基于浏览器的远程数据采集平台和一套移动数据采集系统,吸引全球贡献者参与机器人训练数据的生成。这种架构意味着贡献者无需拥有昂贵的机器人硬件,仅通过网络即可参与数据生产,理论上可以大幅降低数据采集的边际成本。根据公司披露的数据,目前已有超过 10 万名贡献者参与其中,每月采集超过 1200 小时仿真数据和 20000 小时真实世界数据。这一规模如果持续运转,确实有可能形成数据积累上的飞轮效应——数据越多,模型越强,模型越强,吸引更多贡献者加入,而更多贡献者又反过来带来更丰富的数据。
数据引擎不是工具集合,而是一个闭环系统
Axis Robotics 的核心技术架构是一个被内部称为“复合数据引擎”的系统。这个引擎的关键价值不在单一功能,而在于整合了数据生成、采集、训练和改进四个环节的闭环。根据公司描述,该引擎将数据生成、采集、训练和改进整合在同一平台,贡献者采集的数据可能进入训练流程,训练后的模型在真实任务中暴露出的能力短板,又可以转化为新一轮数据采集的指令导向。这意味着数据采集可能不再是盲目的、一次性的行为,而是由模型表现驱动、持续迭代的过程。理论上,这有可能让数据质量和模型性能之间形成正向反馈。
公司已经公开了部分技术成果。其仿真数据集 Sim Dataset V1 在机器人操作基准测试 LIBERO-Plus 上,将整体成功率较现有的 Pi0.5 基线提升了 12.9 个百分点。在物理 AI 的评估尺度上,这是一个值得关注的改进幅度。LIBERO-Plus 是评估机器人泛化操作能力的权威基准之一,涉及物体操控、工具使用和长序列任务,对数据的多样性和质量要求极高。能够在这一基准上取得两位数的提升,意味着 Axis Robotics 在数据生成和筛选环节可能已经积累了一定的技术优势。
Axis Robotics 还计划在 2025 年 9 月发布 Sim Dataset V2,11 月发布 DAgger 数据集。DAgger(Dataset Aggregation)这个命名本身就透露了技术路线的延续性——这是一种经典的模仿学习策略,要求模型在部署过程中持续收集人类纠正数据,以迭代缩小模型行为与专家策略之间的差距。将这一思路产品化,意味着 Axis Robotics 试图在数据层面实现持续学习和快速迭代,而不是一次性交付静态数据集。这种方式更接近机器人实际部署中“边用边学”的需求,如果执行到位,可能为客户提供一种比传统数据采集方式更高效的训练数据供给模式。
不过,12.9 个百分点的提升虽然亮眼,但需要放在合适的语境中理解。基准测试的改进能否线性映射到非结构化真实环境中的表现,仍然是一个开放问题。LIBERO-Plus 作为一个标准化的测试环境,无法完全复现工厂车间或家庭场景中不可预知的变量。目前公开的信息没有披露在工业或家庭场景中的实际部署数据,这使得技术优势的边界尚难精确衡量。此外,仿真数据与真实世界数据之间的性能差距——即所谓的 sim-to-real gap——在多大程度上被 Sim Dataset V1 所弥合,也缺乏量化的对比数据支撑。
商业化的第一脚油门:从车厂到机器人初创的客户矩阵
Axis Robotics 的客户名单已经透露出它在商业化上的策略——同时服务机器人制造商和物理 AI 公司,横跨汽车制造、协作机器人和特种机器人多个垂直场景。已知的合作方包括 Booster Robotics、Manicore Tech、Pigeon Robotics、Dexmal 以及莲花汽车和吉利汽车。
这份客户矩阵有几个值得注意的信号。首先,汽车制造业的入列说明数据需求并非只来自新型机器人公司。传统的自动化产线同样面临柔性制造带来的数据饥渴——当产线需要快速切换生产车型时,机器人需要学习新的装配、焊接和检测动作,而重新编写规则的效率远低于基于数据的模型训练。莲花汽车和吉利汽车作为整车制造商,其产线上的工业机器人需要在高度结构化的环境中实现快速适配,这与新一代机器人公司追求的非结构化环境泛化能力形成了互补需求。其次,Dexmal 代表了灵巧手这一前沿方向,其对精细操作的数据要求远超传统夹爪式末端执行器。Booster Robotics 和 Pigeon Robotics 则覆盖了移动操作和特种作业场景,这些场景下的数据采集通常比固定工位的操作更难通过传统方式完成。Axis Robotics 提供的是定制化训练数据,这暗示其商业模式并非简单的数据集销售,而是嵌入到客户的模型开发流程中,提供持续的数据供给服务。这种深度嵌入的模式一旦建立,客户迁移成本会比较高,可能形成一定的粘性。
不过,定制化服务在商业化早期可以建立深厚的客户关系,但也意味着规模化过程中难以避免的服务成本问题。每增加一个新客户或新场景,可能都需要专门的数据采集方案设计和质量校验流程,这类服务的人力成本是否能随着收入增长而被有效摊薄,目前还无法判断。公司披露的营收模式细节仍十分有限,这使得外界难以判断其单位经济模型和毛利结构。已知客户虽然涵盖了多个细分方向,但合作范围的具体广度、合同金额量级以及是否已转化为持续性收入,公开信息均未指明。
Hack VC 为什么会在数据层下注
领投方 Hack VC 的参与值得单独拆解。这家机构此前在 AI 和加密领域的投资组合显示,它对基础设施层的偏好非常明显。投资 Axis Robotics 的逻辑很可能围绕一个核心判断:物理 AI 的价值链条中,数据层的稀缺性和定价权被严重低估了。
从产业演进规律看,当一个技术领域从实验室走向产业化,最先受益的往往是那些提供“铲子”的公司。在语言 AI 的发展中,数据标注公司、向量数据库和 MLOps 平台都曾在模型公司之前持续获得资本青睐。物理 AI 可能重演这一路径,而且由于机器人数据的获取难度远高于文本数据——前者需要物理交互,后者只需网页抓取——数据基础设施公司的护城河理论上更深。Hack VC 的入场时点说明,它押注的不是某一家机器人公司,而是整个物理 AI 行业即将进入数据驱动的高速增长期。如果这个判断成立,那么作为早期切入数据基础设施层的玩家,Axis Robotics 有可能在行业需求爆发前建立品牌认知和客户基础。
但投资逻辑中的风险同样不容忽视。目前物理 AI 的商业化进程整体处于早期,多数机器人公司尚未实现规模收入,它们能持续为训练数据买单的意愿和能力还有待市场验证。如果终端应用场景未能如预期爆发——比如人形机器人或通用操作机器人迟迟无法找到大规模商业落地的场景——数据基础设施公司将面临需求端的系统性收缩。另外,数据基础设施虽然护城河理论深厚,但这一判断的前提是数据网络的先发优势确实能够持续。如果后来者通过更高的激励方案或更低的价格快速吸引贡献者,众包网络的迁移成本可能并没有想象中那么高。
1200 万美元的投向:开源数据的壁垒是如何建立的
Axis Robotics 明确表示,这笔 1200 万美元的种子轮资金将用于两个方向:增强机器人 AI 训练的数据生成技术,以及扩展全球数据网络。前者指向技术纵深,后者指向网络效应的基础设施铺设。这两个方向并非孤立存在,而是互为支撑——更先进的数据生成技术可以提升采集效率和数据质量,从而吸引更多贡献者加入;而更大规模的贡献者网络又能为技术迭代提供更丰富的反馈数据,加速仿真算法和数据筛选模型的优化。
全球数据网络是一个尤其值得关注的叙事。Axis Robotics 目前宣称拥有超过 10 万名全球贡献者,这个数字在众包逻辑下是关键资产。与集中式数据采集不同,分布在全球的贡献者可以天然带来场景的多样性——不同国家、不同家庭、不同工作环境下的数据,可以覆盖单一实验室无法模拟的物理变量。这种分布式的场景覆盖能力,如果真实兑现,可能会显著降低机器人模型在面对新环境时性能衰变的风险。如果这个网络能够持续扩大并保持活跃,先行者的规模优势可能转化为后来者难以复制的壁垒:新进入者不仅要在技术上追赶,还需要投入大量资源去构建同样规模的贡献者生态,而这在种子阶段公司资金有限的情况下几乎是不可行的。
但贡献者网络的维持同样面临实际挑战。贡献者的激励机制——他们为什么愿意持续贡献数据,报酬模式是计件还是计时,支付标准是否具有竞争力——以及数据质量控制、隐私合规,还有跨地区运营的复杂性,都是规模化过程中必须解决的系统性问题。举个例子,一个分布在全球数十个国家的贡献者网络,意味着公司需要遵守各个司法管辖区关于数据采集、传输和存储的不同规定,合规成本可能随网络扩张而显著上升。公司目前还未披露贡献者经济模型的具体设计,这使得外界对其网络的健康度和可持续性无法做出充分评估。此外,10 万名贡献者中有多少是活跃用户、月度留存率如何、贡献者获取成本是多少,这些通常用于衡量平台健康度的指标也没有公开。
竞争格局中的空白地带与潜在压力
Axis Robotics 将自身定位为物理 AI 数据基础设施公司,这是一个相对细分的定义。目前在公开市场上,尚未出现与之商业模式完全一致、规模相当的直接对标者。这种表面上的“空白地带”在种子轮阶段既是机会——意味着有较长的窗口期来建立品牌和客户关系——也可能是一个警示信号:如果这个细分领域的需求足够明确且广阔,为什么还没有出现更多的竞争者?答案可能是物理 AI 行业整体的成熟度还不足以支撑多家数据基础设施公司的并存,也可能是数据供给的生意天然具有先发优势和网络效应,先行者一旦起跑,后来者的进入门槛会迅速升高。
潜在的竞争可能来自三个方向。第一是机器人即服务公司,它们在自己运营的机器人网络中天然积累了大量真实世界数据,如果这些公司选择将数据能力开放为独立产品,将成为强劲对手。这类公司的优势在于数据和业务场景天然绑定,数据的真实性和场景相关性可能更高。第二是仿真软件巨头,英伟达 Omniverse、Google DeepMind 的仿真环境等,正在加速缩小仿真数据与真实数据之间的性能差距,如果仿真保真度提升到一定程度,可能降低对大规模真实世界采集的依赖。届时,Axis Robotics 引以为傲的真实世界数据规模优势可能面临价值重估。第三是大型云计算厂商,它们拥有雄厚的资本和客户关系,一旦决定进入这一垂直领域,可以快速整合计算、存储和数据服务,形成一站式解决方案,这种“打包销售”的策略可能会挤压独立数据基础设施公司的生存空间。
Axis Robotics 的差异化在于其复合数据引擎和全球贡献者网络的先发优势,但这些优势能否在技术和资本巨头入场后持续,取决于接下来的 12 到 18 个月内,能否在关键客户和数据规模上拉出足够的领先身位。如果在这个时间窗口内无法将技术领先转化为难以替代的客户关系和数据资产,竞争态势可能会迅速恶化。
被绕开的几个关键假设
这轮融资和公司公开的技术路线图,建立在几个尚未被完全验证的假设之上。最核心的一个是,更大规模的数据能够持续带来机器人性能的线性或超线性提升。虽然有 Sim Dataset V1 在 LIBERO-Plus 上的基准测试结果作为佐证,但在非结构化的开放环境中,数据规模与泛化能力之间的关系可能更复杂。存在一种可能是,达到某个阈值后,单纯增加数据量的边际收益快速递减,而真正的瓶颈转移到模型架构或传感器的物理限制上。如果这种情形发生,那么以数据规模为核心卖点的商业模式将面临价值重估。
另一个假设关乎贡献者网络的质量治理。当数据采集来自数万名分布在全球的贡献者时,数据格式的一致性、标注的准确性以及采集场景的可控性都会成为挑战。一个典型的场景是,不同贡献者使用不同的摄像头、在不同的光照条件下采集看似相同的操作任务,但这些变量差异可能导致数据在实际训练中的有效利用率远低于预期。如果质量管控的成本随规模线性甚至超线性增长,众包模式的经济优势将大打折扣。公司目前没有披露质量控制的具体流程和自动化程度,使得外界难以评估这一风险的真实大小。
此外,客户合作的深度和持续性还有待时间验证。已知的合作方名单本身是积极信号——能够同时获得汽车制造巨头和前沿机器人初创公司的认可,说明产品在多个场景中都有一定适用性。但合作关系处于什么阶段——是试点项目、定期采购还是深度集成——公开信息并未指明。这些细节将决定收入的可预测性和客户的生命周期价值。在 B2B 数据服务领域,试点项目转化为持续性合同的比例通常不高,而客户流失率则是影响公司长期估值的核心变量。目前没有任何公开数据可以用来评估 Axis Robotics 在这些维度上的表现。
还有一个隐含的假设是,整个物理 AI 行业的训练范式会向数据驱动方向持续演进。如果未来出现新的模型架构或训练方法,显著降低了对大规模训练数据的依赖——这类技术突破在 AI 历史上并不罕见——那么数据基础设施公司的价值主张可能需要重新定义。
Chris Feng 和一个未被讲述的公司背景
关于创始人 Chris Feng,公开信息仅限于他在融资声明中的判断和规划。他明确提出物理 AI 的竞争重心在数据而非模型,这个判断本身反映了一定的行业认知深度——能够穿透模型层的热闹表象、看到数据层的结构性问题,说明创始团队对物理 AI 产业链的痛点有比较清晰的理解。但关于他的教育背景、此前创业经历以及创始团队的规模和结构,目前均未披露。
从一个更务实的视角看,种子轮阶段创始团队的完整画像往往比技术路线图更能预示公司的执行能力和发展轨迹。一个在机器人数据采集或众包平台领域有过实操经验的团队,和一个首次创业的技术团队,在面对贡献者网络运营、客户关系管理、跨地区合规等复杂挑战时的应对能力可能截然不同。Axis Robotics 的团队规模、技术骨干来源和行业经验,是判断其能否将 1200 万美元高效转化为技术壁垒和客户增长的关键变量,而这些信息目前仍属空白。此外,公司的总部所在地、注册地以及运营实体的法律结构也未披露——这些因素直接影响公司的合规框架和资本市场路径,对于一家运营全球贡献者网络的数据公司而言,这并非无关紧要的细节。
RecodeX 极客视点:物理 AI 的叙事正在从“造一个更聪明的机器人”转向“为机器人造一个可学习的现实”。Axis Robotics 用众包数据引擎切入的,恰恰是这个转移中最疼的痛点。但数据基础设施公司面临的根本挑战在于,它赌的是整个行业的需求爆发,而自身议价权建立的速度,必须快于技术扩散和巨头入场叠加的挤压。12.9 个百分点的基准提升是一个不错的开局,接下来的问题是:当客户自己的数据能力成长起来时,Axis Robotics 还能继续卖出铲子吗?