当一台人形机器人试图在超市货架间识别商品并完成补货时,它最大的敌人不是代码逻辑,而是缺少足够多“在真实超市货架间伸手”的训练数据。模拟器能生成无限图像,但触觉反馈、裸手抓握的力度、UMI夹爪接触不同材质包装时的微妙差异——这些物理世界特有的信号永远无法被虚拟环境穷尽。

2026年8月,具身智能公司的工程师们已经不再争论算法架构的优劣,而是开始抢夺同一种稀缺资源:高质量、多模态的真实世界交互数据。这正是恺望数据切入战场的时机。8月4日,这家成立仅四年的AI数据基建公司宣布完成逾亿元战略融资。与多数融资公告不同的是,出现在投资方名单中的不仅是财务投资机构,还有鹿明机器人、松延动力、自变量机器人以及智元机器人旗下觅蜂科技等多家头部具身智能公司本身。

下游客户直接出资押注上游数据供应商,在尚处早期的具身智能赛道极为罕见。这揭示了一个正在形成的产业共识:数据供给不足已成为整个物理AI(Physical AI)产业的最大瓶颈。

字段 内容
公司 恺望数据
轮次 战略投资
金额 逾亿元
投资方 北京亦庄产业升级基金、华方资本、天际资本联合领投;新鼎资本、迈睿资管、兴华鼎立、华章投资、伦达川润,以及鹿明机器人、松延动力、自变量机器人、智元旗下觅蜂科技跟投;亚盛资本、清智资本、璞跃资本追加投资
总部 未披露
创始人 于旭
官网 https://admin.d.konvery.com/login

一场从道路上开始的数据战,正在蔓延进厨房和工厂

恺望数据的基本盘建立在自动驾驶领域——这是Physical AI最早实现规模化落地的场景。公司成立于2022年,创始人于旭曾为Uber第四号员工,拥有0-1平台搭建与大规模资源运营经验。从自动驾驶切入数据服务市场是一个务实的选择:这个行业早已过了“需要不需要数据”的争论阶段,进入“需要多少数据、什么质量的数据”的精细化竞争期。

围绕端到端系统及垂类世界模型的训练需求,恺望数据目前已覆盖乘用车、商用车、物流车全品类车企和自动驾驶算法企业,持续输出标准化道路场景多模态数据。更具行业创新意义的尝试发生在2025年:公司推出了行业首个数据“拼车”产品,这一模式已成为北京自动驾驶众源共享的新范式。

所谓“拼车”,本质上是一种数据资产共享机制。不同车企或算法公司的采集车辆在路上行驶时,产生的道路场景数据存在大量重叠——同一段高速公路、同一个十字路口被无数辆车反复记录。传统模式下,每家公司各自采集、各自标注,造成巨大的重复投入。“拼车”产品将采集任务在多个需求方之间协同分配,降低单家企业的数据获取成本,同时提升整体行业的数据覆盖效率。这是一个基础设施级别的创新,它试图解决的不是某一家企业的数据需求,而是整个自动驾驶产业的数据供给效率问题。

但恺望数据真正的增长想象空间不在道路,而在2025年开始爆发的具身智能赛道。当AI从结构化道路场景(车道线清晰、红绿灯规范)进入开放、复杂的真实物理环境(厨房台面杂乱、工厂产线环境光线多变、家庭客厅布局千差万别),数据的稀缺性陡然上升。觅蜂科技董事长兼CEO姚卯青此前曾公开表示,物理AI要实现规模化必须突破“三道墙”,其中“数据墙”是指真实交互的数据稀缺且获取成本高。

恺望数据目前覆盖的数据品类已远超传统图像标注范畴,包括第一视角裸手操作视频、触觉传感手套采集的力反馈数据、UMI夹爪(通用操作接口手持夹爪)运动数据,以及第三视角全景视频等多模态数据。更为关键的是,据公司披露,公司已入驻商超、餐饮门店、家庭空间、汽车工业产线等实景环境完成数据服务。这意味着其数据采集网络正在从公共道路延展到商业化最敏感、也最有价值的私人空间和工业场景。

10万小时产能背后的工程化能力,是竞争对手最难复制的壁垒

数据服务行业的一个典型特征是:任何人都可以组建标注团队,但极少有人能在真实场景中实现规模化交付。单点采集的难度不高——派几个人带着设备去超市录一天视频并不复杂。困难在于,当需求方要求“每周交付5000小时高质量、多传感器对齐的家庭厨房操作数据”时,绝大多数供应商会在第三周崩溃。

据公司披露,单月有效数据产出稳定在接近10万小时水平。此前行业公认的规模化门槛约为1万小时有效数据,恺望数据将这个数字提升了近一个数量级。这里的“有效”二字是关键限定词——并非摄像头开机时长,而是经过语义精加工、可直接用于模型训练的数据量。从原始采集数据到有效训练数据之间,通常需要经历数据清洗、帧对齐、多模态时间戳同步、语义标注等多个环节,每一步都会带来损耗。

支撑这一产能的核心是公司搭建的覆盖数据定义、实地采集、语义精加工、标准化交易流通的完整业务闭环。在华方资本的表述中,恺望数据“具备完整的数据采集、加工、治理闭环能力,深度适配人形机器人与物理智能产业需求”。值得注意的是“适配”二字——不同形态的机器人(双足人形、轮式、协作臂)对数据格式、传感器配准、操作空间坐标系的要求各不相同,一套数据处理管线能否灵活适配多种下游需求,直接决定了数据供应商能否撬动足够大的市场。

目前已公开的客户合作进展验证了这种适配能力。多家头部具身智能公司与恺望数据达成批量数据采购合作,而本轮融资中鹿明机器人、松延动力等公司的直接投资,本身即是一种最强有力的商业背书——客户在看过产品之后,用投资款而非采购订单来表达对供应商战略价值的判断。

具身智能公司亲自押注数据层,透露了产业链的深层焦虑

本轮融资的资本结构极不寻常。一家数据服务商的股东名单中,同时出现了地方政府产业基金(北京亦庄产业升级基金)、市场化VC(天际资本、华方资本)、老牌投资机构(亚盛资本、清智资本),以及四家头部具身智能公司。这种“国资+VC+产业下游客户”的混合结构,在AI数据服务赛道尚属首次出现。

具身智能公司投资方给出的解释直白而紧迫:“到真实世界中大规模采集数据,是通往具身智能唯一正确途径。”投资方进一步表示,本次投资既是自身对具身数据基础设施的前瞻布局,也是公司在真实场景中持续获取高质量数据、加速产品进化的关键助力,将补强公司在数据供给、标准建设和生态协同方面的能力。

这一表述揭示了具身智能公司当前面临的真实困境。与自动驾驶可以在相对受控的道路环境中用数百万辆量产车回传数据不同,人形机器人目前保有量极小,且绝大多数时间在实验室运行。即便实验室内部采集了大量操作数据,其光照条件、背景环境、物品材质都与真实商业场景存在系统性差异。这种差异在机器学习中被称为“域偏移”,直接导致实验室表现优异的模型在真实环境中失效。

具身智能公司的另一种选择是自己大规模采集数据,但这条路成本极高。自建采集团队需要在全国多个城市的商超、家庭、工厂布设采集设备,协调场地准入,处理数据隐私合规问题,维护成百上千套传感器设备的稳定运行。对大多数尚处在产品研发阶段的机器人公司而言,同时负担算法研发与大规模数据基建并不现实。

恺望数据恰好填补了这个中间层。它向上游连接大量真实场景(商超、餐饮、家庭、工厂产线),向下游输出标准化、可直接训练的数据产品。对具身智能公司而言,以战略投资绑定一家关键数据供应商,既能确保数据获取的优先权,又避免了自己陷入数据采集的持续重投入中。

天际资本的判断更偏向产业趋势视角:“AI产业已从算法革命迈入数据革命,大模型商业化、自动驾驶规模化、具身智能产业化三大浪潮共振,AI数据服务迎来高速发展期。”这与市场近期对数据基建价值的重新认知一致——当模型架构逐渐趋同(大量团队使用Transformer或其变体),差异化竞争的关键越来越前移到训练数据的质量和规模上。

政府产业基金入局的信号:数据已被视为城市级基础设施

北京亦庄产业升级基金在本轮融资中担任联合领投方,这一细节不能被忽略。亦庄是北京自动驾驶产业的核心承载区,也是“人工智能之城”建设的主要依托。产业升级基金的投资逻辑不以短期财务回报为唯一目标,更看重被投企业能否融入区域产业集群、带动上下游协同。

对恺望数据而言,亦庄产业升级基金的背书至少带来三重价值。其一,是场景准入的便利性——在亦庄范围内,公司更容易获得真实道路场景、工业园区的数据采集权限。其二,是政策支持——数据资产交易、数据跨境流动等环节涉及复杂的监管框架,有地方政府产业基金参与的企业往往能与监管部门建立更顺畅的沟通渠道。其三,是生态协同——亦庄聚集了大量自动驾驶和机器人企业,恺望数据的“拼车”模式和其他数据共享产品,在一个产业集群的密度上更容易发挥网络效应。

从政策趋势看,高质量数据正被提升到类似算力的新型基础设施高度。当政府产业基金开始系统性投资数据供给层企业,意味着数据交易、数据标准化、数据产权界定等制度性安排可能正在酝酿加快。恺望数据在亦庄的战略定位,使其有机会参与这些早期规则的设计。

从数据采集到数据交易平台,恺望数据想成为AI时代的“数据石油管道”

按照公司披露的资金用途,本轮融资将重点投向三个方向:一体化数据交易平台研发、世界模型专项技术人才引进、商业/工业/家庭三大领域真实场景的规模化数据产能扩建。

值得重点关注的是“一体化数据交易平台”。这个措辞意味着恺望数据并不满足于做一家数据采集和标注服务商,它试图构建一个数据资产的标准交易通道。在理想形态下,这个平台的一端接入各类真实场景数据源(车企车队、店内摄像头、工厂传感器),另一端服务不同类型的数据需求方(自动驾驶公司、具身智能公司、世界模型研发团队),平台本身负责数据清洗、格式标准化、质量审核与合规脱敏。

这一思路与“数据拼车”产品一脉相承,但范围更广。数据交易平台的关键难点不在于技术架构,而在于定价机制和交易撮合效率。数据资产的异构性极高——一段高速公路视频对自动驾驶公司的价值可能极高,对具身智能公司则几乎没有用处。如何定义数据的质量等级、稀缺度、复用价值,如何让买卖双方在平台上快速匹配,这些问题的复杂度远超淘宝或滴滴曾经面对的标准化商品撮合。

恺望数据的具体思路并未公开披露,但CEO于旭在融资公告中的表述提供了线索:“依托成熟规模化生产能力、覆盖智驾与机器人双赛道业务底盘,恺望数据将持续扩大实景数据供给规模,革新数据共享流通模式。”——“革新数据共享流通模式”而非“提供更多数据服务”,指向的是规则层面的基础设施构建。

世界模型专项人才引进则指向另一个竞争力维度。世界模型是Physical AI的最核心组成部分之一,它要求AI不仅理解图像中的物体是什么,还要理解重力如何作用、液体如何流动、物体被推动后的运动轨迹等物理规律。训练世界模型所需的标注维度远超传统任务,需要既懂物理仿真又懂深度学习的复合型人才。恺望数据布局这一方向,说明它试图向数据价值链的更上游移动——不仅提供原始素材,还提供经过物理规则校验的训练资源。

两条赛道并行的结构性风险,与数据交易的制度性不确定性

尽管本轮融资展现了产业资本与政府双重背书,但恺望数据面临的挑战同样不可忽视。

第一条挑战来自赛道间的资源分配冲突。自动驾驶数据业务贡献了公司成立三年来的主要营收和技术积累,具身智能数据业务则是未来想象空间的核心支撑。两条赛道的需求差异巨大:自动驾驶侧重视野外道路、夜间场景、恶劣天气等长尾工况的数据覆盖;具身智能侧则需要室内精细操作、多传感器融合、触觉力反馈等近距离交互数据。两者的采集设备、标注工具、质量验收标准均有不同。在产能扩建过程中,如何在两个赛道间分配人力和资金,避免出现“老业务被抽血、新业务未接上”的风险,考验着管理层的资源调度能力。

第二条挑战是数据壁垒的可复制性。10万小时月产能是当下竞争对手难以短时间突破的规模化门槛,但这个门槛并非绝对稳固。如果未来出现大幅降低人工标注依赖的技术突破——例如自监督学习在大规模视频数据上的预训练效果达到可用水平——那么数据服务商的加工环节价值可能被压缩。当然,从当前技术趋势看,多模态真实交互数据的采集环节仍然具有高度不可替代性。

第三条挑战更为隐蔽但影响深远:数据交易的制度框架尚未建立。恺望数据在家庭空间、商超内部采集的数据涉及大量个人信息和商业场所隐私问题。目前行业用脱敏、模糊化处理来应对合规要求,但长期而言,数据的确权、定价、交易合规仍缺乏法律层面的清晰界定。数据交易平台的构想能否跑通,在很大程度上不取决于技术,而取决于监管环境。

最后一个待验证的假设是营收结构转型。恺望数据未披露当前营收中自动驾驶业务与具身智能业务的具体占比,也未披露具身智能业务的客户合同金额和复购率。公司称具身智能订单“仅花了半年就实现‘超越’”——此处原文在创业邦报道中未明确超越的具体参照值,可能是超越自动驾驶业务增速或订单量,但精确口径需要进一步确认。在数据公开有限的情况下,具身智能业务能否在营收规模上成长为与自动驾驶并驾齐驱的第二曲线,仍是开放性问题。

当数据变成生产资料,谁掌握源头谁就掌握了价值链的分配权

恺望数据此轮融资传递出的最强烈信号,不是某一家公司获得了多少钱,而是整个AI产业链的权力结构正在发生转变。过去十年,AI行业的叙事中心始终在算法——谁的模型参数更大、谁的架构更精巧。但进入Physical AI时代,算法创新的边际收益在递减,而高质量真实世界数据的供给弹性极低。训练一个机器人学会叠衣服,瓶颈不在模型设计,而在你手上有多少个真实家庭里、不同材质衣服、被不同人叠了上万次的视频数据。

当四家头部机器人公司集体出钱投资一家数据供应商,这本身就是一种集体表态:产业链中最稀缺的环节在哪里,资本和战略注意力就应该集中在哪里。恺望数据正试图将自己定义为一个中立的、面向整个物理AI生态的数据基础设施运营者。这个定位一旦稳固,其在生态中的议价权和战略价值将远超一家普通的数据服务外包公司。

但数据基础设施的构建从来不只是商业问题。权限、隐私、标准、交易规则——每一个环节都涉及公共治理。恺望数据在亦庄的政企合作模式能否在北京乃至全国复制、数据交易平台在多大规模上能跑通市场化运营,这些答案只能交给时间去验证。

RecodeX 极客视:AI从数字世界走向物理世界的每一步,都踩在一层看不见的数据地基层上。恺望数据代表的数据基建方向揭示了行业的共同焦虑——当算法不再稀缺,数据才是新的石油,而采集、加工和交易石油的通道,正在吸引前所未有的产业资本入场。但石油需要管道,更需要纠纷解决机制和行业标准,这套体系的成熟度,将决定数据服务商能否从“卖水人”进化为真正的生态级基础设施。

信息来源

本文在采集与核验阶段引用了以下公开来源,按站点去重列出;来源内容归原发布方所有,其口径不代表 RecodeX 的核实结论。