Ropedia 完成 2200 万美元 Pre-A 轮融资:当具身智能遭遇“数据荒”,这家新加坡公司如何用头戴硬件 HOMIE 重构物理世界的 ChatGPT 时刻?
在旧金山一场闭门机器人开发者聚会上,一位来自艾伦人工智能研究所(AI2)的研究员展示了一段令人瞠目的视频:一个机械臂,在没有经过任何特定场景编程的情况下,流畅地完成了“将一颗蓝莓精准放置在微型蛋糕顶端”的动作。台下的人们窃窃私语,猜测这是哪个实验室耗费了上万小时训练的成果。研究员微微一笑,揭晓了答案:“这个模型超过一半的‘老师’,是一家你们可能没听过的公司——Ropedia。”
这句话像一颗石子投入平静的湖面。在场的 VC 和工程师们瞬间意识到,那个困扰具身智能行业已久的“幽灵”——物理世界的海量、高质量数据从哪里来——似乎被悄然触碰到了开关。当全球 AI 社区还在为 LLM 的文本数据枯竭而焦虑时,一个更致命的“数据荒”正在机器人领域蔓延。而这家总部位于新加坡、刚刚完成 2200 万美元 Pre-A 轮融资的初创公司,正试图用一顶看似不起眼的“皇冠”,撬开物理世界的“ChatGPT 时刻”。
当互联网“喂不饱”机器:具身智能撞上的那道“数据墙”
2023 年,当整个科技界沉浸于 GPT-4 带来的文本生成狂欢时,一个隐秘的焦虑开始在顶尖机器人实验室里蔓延。波士顿动力的人形机器人 Atlas 可以完成令人惊叹的后空翻,但面对一个从未见过的门把手,它依然会陷入“认知死机”。特斯拉的 Optimus 原型机在演示中步履蹒跚,其核心瓶颈并非电机或电池,而是缺乏足够的“物理常识”。
这种割裂感源于一个根本性的矛盾:大语言模型(LLM)的成功,建立在对互联网海量文本和代码的近乎“暴力”的吞噬之上。据 Epoch AI 估算,用于训练 GPT-4 的高质量文本数据可能高达 13 万亿 token。然而,这种“数据石油”的钻井在物理世界彻底失灵。你可以让 LLM 读完所有关于“拧螺丝”的说明书、维基百科条目和 YouTube 视频,但它依然无法输出力矩、角度和接触力,让一只机械手真正拧紧一颗螺丝。
“互联网上几乎不存在人类进行物理交互的原始数据。”Ropedia 创始人兼 CEO 陈昭熹(Zhaoxi Chen)在位于新加坡 Fusionopolis 的办公室里,一边调试着一个原型设备,一边向我解释。“你能找到的,都是经过剪辑、配乐、被摄像机第三视角记录下来的内容。它丢失了最重要的东西:第一人称视角的视觉流、手腕的微小抖动、指尖的触觉反馈,以及‘任务是否成功’的结果标注。”这堵“数据墙”(Data Wall)成为了具身智能(Embodied AI)和物理 AI(Physical AI)从实验室走向商业化的最大路障。
传统破解方案是“遥操作”(Teleoperation)。研究人员戴上 VR 头显,用昂贵的力反馈手套,像操纵提线木偶一样,一帧一帧地教机器人做动作。这种方法不仅效率低到令人发指——收集 1 小时有效数据可能需要 10 小时的专家操作——而且成本极高。一台高精度遥操作系统的价格动辄数十万美元,且操作者极易疲劳。当行业需要数百万甚至上亿小时的训练数据来构建通用物理基础模型时,遥操作就像是用勺子挖穿一座山。整个行业陷入了一个悖论:机器人需要像 ChatGPT 一样的数据规模来“开悟”,但人类却无法以互联网的速度生产这些数据。
正是在这种“数据饥荒”的绝望氛围中,Ropedia 提出了一个看似反直觉的路径:与其让昂贵且笨拙的机器人去模仿人类,不如让人类成为最自然的“数据生成器”。
“数据皇冠”HOMIE:一场关于“无感采集”的硬件革命
陈昭熹从办公桌抽屉里拿出了一个白色的环形设备,外形极简,像一件轻盈的装饰品。这就是 Ropedia 的核心武器——HOMIE(Human-centric Omni Interaction and Experience)。它的重量不到 0.5 磅(约 225 克),甚至比一些高端运动耳机还要轻。戴上它,你不会感到任何压迫感,视线也完全不受阻挡,因为它采用了类似皇冠的开放式设计,将传感器阵列巧妙地分布在头部周围。
“HOMIE 的设计哲学是‘零干扰’。”陈昭熹解释道,“我们不是要创造一个科幻电影里的眼罩。我们想让一个流水线工人、一位米其林大厨、甚至是外科医生,在完全无感的佩戴状态下,完成他们的日常工作。”这个看似简单的目标背后,是极其复杂的工程挑战。
HOMIE 装备了 4 个方位视角的摄像头,通过空间算法实时捕捉佩戴者的第一人称视觉流。但这只是开始。真正的技术壁垒在于它对“多模态数据”的同步采集。当一个人戴上 HOMIE 去组装一个精密仪器时,设备不仅记录下他看到了什么(视觉),还通过头戴式惯性测量单元(IMU)捕捉他头部的运动轨迹(空间几何),通过计算机视觉算法重建他的手部与物体的交互姿态(运动轨迹),并最终通过结果检测(比如螺丝是否拧紧)来标注操作的成功与否(操作结果)。
“我们实际上是在创造一种新的数据格式。”Ropedia 的 CTO,一位来自麻省理工学院机器人实验室的资深工程师补充道,“这不仅仅是视频。这是一次物理交互的完整切片,包含了时间、空间、视觉、动作和因果关系的全部信息。”这种数据的价值,在于它的“原生性”。它不是通过第三方视角推测出来的,而是从人类感知世界的“第一人称”源头直接提取的。它天然地包含了人类在操作过程中的决策逻辑、容错机制和对环境变化的适应能力。
为了验证 HOMIE 的泛化能力,Ropedia 团队进行了一系列极端测试。他们让不同年龄、不同身高、甚至不同文化背景的人戴上 HOMIE 去完成同一个任务——比如“切胡萝卜”。结果令人振奋:尽管每个人的手法、节奏和习惯千差万别,但 HOMIE 采集到的数据底层,都共享着相同的物理逻辑:刀与砧板的垂直关系、施加于胡萝卜的切割力、以及防止滑动的支撑手位置。这种“多样性中的统一性”,正是训练通用机器人模型最需要的“黄金数据”。
“当你拥有 10,000 台 HOMIE 同时在世界各地的厨房、工厂、实验室、农场里采集数据时,机器人训练的数据瓶颈将不复存在。”陈昭熹描绘着即将到来的蓝图。Ropedia 正在规划第二代 HOMIE 硬件,目标是进一步将重量降低到 150 克以下,并采用更时尚、更具佩戴性的设计。他们计划在 2025 年底前实现 10,000 台的规模化量产。这不仅仅是一个硬件销售计划,这是一个物理世界数据采集网络的“节点部署”计划。
“我们不是在卖摄像头,”陈昭熹强调,“我们在铺设一条物理世界的‘数据管道’。”
从“提线木偶”到“数据炼油”:Ropedia 的标注层炼金术
采集原始数据只是第一步。如果未经处理,HOMIE 产出的数据流只是一堆杂乱的、充满噪声的、难以被 AI 模型消化的“原油”。真正让 Ropedia 脱颖而出,并获得像 AI2 这样的顶尖研究机构青睐的,是它构建的那套位于采集层和部署层之间的“标注层”——一套自动化清洗、过滤、质量控制与 AI 辅助多模态标注的工业化流水线。
“很多公司都在做数据采集,但没有人像我们这样,把数据标注当作一个工程系统来构建。”陈昭熹说。在 Ropedia 的技术架构中,数据采集由 HOMIE 完成,数据部署则服务于客户的各种机器人本体(从协作机械臂到人形机器人)。而中间的“标注层”,则是 Ropedia 的核心价值所在,也是其商业模式的基石。
这套系统的工作原理类似于一个多级“炼油厂”。首先,原始数据流会经过一个“质量过滤器”,利用计算机视觉模型自动剔除那些操作失败、视角遮挡严重或佩戴者分心的低质量片段。然后,进入“语义对齐器”,系统会自动识别并分割出不同的动作单元——例如“拿起螺丝刀”、“对准螺丝”、“旋转三圈”。这个过程不再依赖人工逐帧标记,而是通过 Ropedia 自研的时空动作检测模型自动完成。
接下来是最关键的一步:“物理量标注”。系统会利用多视角几何和视觉伺服技术,自动反算出操作过程中手部施加的力、物体的滑动、以及接触点的摩擦系数等物理参数。这些信息对于机器人学习精细操作至关重要。最后,所有数据会被转化为一种标准化的、与机器人本体无关的“动作基元”格式。这意味着,一个由 HOMIE 采集的人类切菜数据,可以无缝转化为一个机械臂的切割程序,无论这个机械臂是 KUKA 的、ABB 的还是宇树科技的。
这种“数据炼油”能力,直接为 Ropedia 赢得了来自顶级 AI 研究机构的认可。今年早些时候,艾伦人工智能研究所(AI2)发布了其最新的 3D 运动预测大模型 MolmoMotion。这个模型旨在让 AI 理解物理世界的动态变化,能够预测下一秒物体的位置和运动轨迹。在模型的训练过程中,超过 50% 的训练数据竟然是由 Ropedia 独家提供的。
“MolmoMotion 的团队最初尝试了各种公开数据集,但都因为缺乏真实的 3D 交互信息和精细的动作标注而失败。”一位接近该项目的消息人士透露,“直到他们接触了 Ropedia 的数据集,才发现这正是他们需要的‘物理教科书’。Ropedia 的数据让模型第一次学会了预测‘一个茶杯被推下桌沿时会如何翻滚’。”这一合作,让 Ropedia 在具身智能数据领域的地位,从“备选方案”一跃成为“行业标准制定者”的潜在候选。
“这就像 AWS 为互联网公司提供了计算基础设施,”陈昭熹比喻道,“我们正在为物理 AI 公司提供‘数据基础设施’。你可以选择租用我们的标准化数据集,也可以让我们带着 HOMIE 和标注系统进入你的工厂,为你定制一套专属的‘知识蒸馏’方案。”
2200 万美元的赌注:为什么 VC 认为“数据管道”比“机器人本体”更性感?
当 Ropedia 宣布完成 2200 万美元 Pre-A 轮融资时,整个创投圈都开始重新审视具身智能领域的投资逻辑。在过去两年,资本狂热地追逐着人形机器人本体公司,诸如 Figure AI、1X Technologies 等,动辄融资数亿美元。但 Ropedia 的故事提供了一个截然不同的视角:在“淘金热”中,卖铲子的人或许才是风险最低、回报最稳的赢家。
“投资 Ropedia 的逻辑,本质上是在投资一个‘必然性’。”领投本轮融资的某全球顶级风投合伙人分析道,“无论最终哪家机器人公司的本体胜出,它们都需要海量的、高质量的物理数据来训练大脑。Ropedia 切中的是这个价值链中最具网络效应和规模效应的环节。数据管道一旦铺设完成,客户切换成本极高。”这种“基础设施”思维,在 AI 历史上屡试不爽。NVIDIA 凭借 GPU 成为 AI 算力基础设施,市值超越所有 AI 应用公司。在物理 AI 时代,数据基础设施的“赢家通吃”效应可能更为显著。
Ropedia 的商业模式也印证了这一点。它不销售昂贵的机器人硬件,而是提供一种类似于“数据订阅”的服务。客户每年支付数百万美元的授权费,即可访问 Ropedia 不断增长的、涵盖数百种操作场景的标准数据集。或者,客户可以选择“数据工厂”模式,Ropedia 会派遣训练有素的操作员(佩戴 HOMIE)入驻客户工厂,在真实生产线上采集并加工专属数据,帮助客户将人类工艺大师的经验转化为可复用的机器人技能。
“我们正在帮助一家世界顶级的半导体设备制造商,将他们资深工程师的芯片封装手艺‘数字化’。”陈昭熹透露了一个正在进行的项目,“这位工程师有 30 年经验,他操作时的很多‘手感’和‘直觉’根本无法用语言描述。但通过 HOMIE 采集的 100 小时数据,我们成功训练出了一个 AI 模型,能够复现其 90% 以上的操作精度。”这种将人类“默会知识”(Tacit Knowledge)转化为可编程、可复制、可扩展的数据资产的能力,是 Ropedia 最令产业界兴奋的地方。
2200 万美元的资金,将主要用于两个方向:一是加速 HOMIE 硬件的迭代和规模化量产,目标是在 2025 年底前将产能提升至 10,000 台;二是在北美建立大型分支机构,招募顶尖的硬件、软件和 AI 基础设施人才。硅谷将是 Ropedia 的下一个主战场,这里聚集着全球最激进的机器人创业公司和最挑剔的 AI 研究机构。
“新加坡是极好的研发基地,但市场和客户在北美。”陈昭熹坦言,“我们需要离‘炮火’更近一些,去理解客户最真实的需求,去参与最前沿的模型训练。”Ropedia 的扩张计划,预示着这家公司正试图从一家“技术领先的硬件公司”转型为“定义行业标准的数据平台”。
“ChatGPT 时刻”的倒计时:当机器人终于有了“物理常识”
回到文章开头的那个场景。AI2 的 MolmoMotion 模型之所以能预测蓝莓的放置动作,是因为它在 Ropedia 提供的数据中,学到了人类在类似精细操作中的“物理直觉”——如何调整指尖的力度以防捏碎水果,如何根据蛋糕的柔软度来调整放置的深度。这种“物理常识”的习得,正是通往机器人“ChatGPT 时刻”的最后一把钥匙。
“ChatGPT 时刻”不仅仅意味着一个能对话的机器人,它意味着一个机器人能够像 GPT-3 理解语言一样,理解物理世界的底层逻辑。它意味着机器人不再需要为每个新任务重新编程,而是可以像人类一样,通过观察和少量示范,就能泛化到从未见过的场景中。这需要的不再是几万小时的特定任务数据,而是数百万乃至数亿小时的、覆盖各种物理交互的“通用物理数据”。
Ropedia 的野心,就是成为这个“通用物理数据”的唯一源头。当 HOMIE 的数量从几百台增长到几万台,当采集场景从实验室扩展到工厂、家庭、医院、农场,一个关于人类物理行为的“数字双胞胎”将逐渐成形。这个双胞胎不仅记录了“做了什么”,更记录了“怎么做”以及“为什么会成功或失败”。
“我们正在经历的,是一个比互联网数据爆发更深刻的变革。”陈昭熹在采访结束时说道,“互联网数据改变了人类的信息获取方式。而物理数据将改变人类与物质世界的交互方式。当每一双手套、每一把螺丝刀、每一个门把手都变成了数据传感器,当机器人的大脑里充满了这些真实的物理交互记忆,那个所谓的‘ChatGPT 时刻’就会自然而然地到来。它不会是一个突兀的新闻事件,而是一个水到渠成的结果。”
Ropedia 的故事,不再是一个关于新加坡创业公司的融资新闻。它是一个关于如何用最轻量、最人性化的方式,去解决 AI 最底层、最沉重的难题的宏大叙事。在具身智能的漫漫征途中,当所有人都盯着机器人的钢铁之躯时,Ropedia 选择了一条更艰难但也更根本的道路——去捕捉那些驱动钢铁之躯的、来自人类灵魂的每一次触碰、每一次发力、每一次成功的喜悦和失败的懊恼。而这,或许正是通往通用人工智能的真正“捷径”。