原文:10 Emerging Robotics Infrastructure Themes
作者:Kahini Shah, Partner @ Obvious
来源:SandHill.io #299 推荐阅读 · Investment Themes & Theses

我们见过人形机器人后空翻,四足机器人玩跑酷,夹爪能轻轻拧上灯泡。随着机器人从原型走向量产,我们一直在问:建造者现在最需要什么,才能加速这一进程?
我们把答案收敛到十大关键创新领域,分属三个类别:教机器人「做什么」的数据与环境,让它「真正做得到」的硬件与网络,以及把这一切变成可部署系统的软件平台。

数据与仿真(Data & Simulation)
大语言模型(LLM)有互联网上的文本可以学习。机器人没有对等物。伯克利教授 Ken Goldberg 把这称作机器人领域的「十万年数据缺口」(100,000-year data gap)。并不存在一座现成的、规模巨大的物理世界档案,可以拿来训练机器人模型去捡起东西、走过不可预测的地形,或在绊倒后恢复。要弥合这个数据缺口,需要创新:
- 数据采集平台: 机器人数据可以来自真实世界,也可以来自仿真。真实世界数据包括视频(第一人称/egocentric、第三人称/exocentric 等)、通用操作接口(Universal Manipulation Interface, UMI)、遥操作(teleoperation),以及生产数据。采集多样、高质量的数据很难。用来捕捉数据的物理硬件装置、采集到的数据本身,以及如何标注,都会决定它对训练模型有多大用处。那些提供生产级规模数据集、以及处理这些数据的工具的「镐与铲」(pick-and-shovel)平台,代表着巨大机会。
- UMI 采集设备: 通用操作接口(UMI)框架让人类可以用手持夹爪,把操作技能教给机器人。UMI 设备需要足够舒适,好让人能在训练时段一直戴着;同时必须采集足够干净的数据,才能迁移到机器人的硬件上。把这两件事做对,或许能造出机器人界的 Tesla——一套在用户几乎无感的情况下被动训练出来的自主系统。正如 Nvidia 的 Jim Fan 在 Robotics’ End Game YouTube 里所说:「戴着这些 UMI 或数据采集可穿戴设备仍然很笨重,远不像开车去上班那么无缝,所以我们需要一个 FSD 的等价物。」
- 仿真器: 相对真实世界采集,仿真器提供了一种可扩展的数据生成方法。NVIDIA 的 Isaac Sim 和 MuJoCo 这类多物理仿真器(multi-physics simulators),能在几分钟内生成数小时的训练数据。但这些仿真器仍有局限,例如准确建模衣服这类可变形物体,或水这类液体。此外,在这些理想化环境中训练出的策略,部署时常常会失败,原因是未建模的真实世界因素——这种错配被称为 sim2real gap(仿真到现实的鸿沟)。Eka Robotics 展示了有希望克服仿真局限的证据,尤其是它们采摘娇嫩树莓的演示。更快、更精确的多物理仿真器,将进一步缩小数据缺口。
- 世界模型(World Models): 世界模型是一种为环境建立内部表征的 AI 系统。该模型会预测环境如何随时间、随动作而变化。Waymo 已成功把世界模型用于自动驾驶,以加速自主能力,仿真从罕见事件(比如一辆车遇到一头大象)到开放式的「如果……会怎样」情景。MOE Capital 的 Henry Yin 和 Naomi Xia 在文章 The Model That Dreams the World 中概括了机器人在这一点上处于何处。对机器人而言,世界模型可以成为更好的规划器,也可以成为更好的仿真器。通过创造更真实的环境表征,世界模型有助于打造 sim2real gap 更小的机器人策略。
硬件与网络(Hardware & Networking)
机器人是硬件与软件紧耦合的系统。在数字世界里,文本可以作为模型相对硬件无关的标准输入与输出。机器人硬件栈由传感器、执行器(actuators)、电池和 GPU 组成。在机器人里,输入和输出都依赖硬件。机器人通过各种传感器(如视觉、lidar、力觉)感知世界,并向各种电机和执行器输出控制指令。因此,机器人硬件的进展很重要。这些机会领域包括:
- 实时遥操作(Real Time Teleoperations): 遥操作用来采集数据、微调行为,并在现场把卡住的机器人救出来。但今天的系统有真实约束:网络延迟、连接不稳定、视频编解码延迟,以及只依赖视觉反馈——因为低延迟的触觉回路(haptic loops)很难实现。没有触觉,操作员就感觉不到物理接触,安全、准确地操作会困难得多。一套能让人从任何地方进行直观、远距离遥操作的方案,会成为机器人训练与部署的赋能器。
- 回流/在岸化(Onshoring): 不断升温的地缘政治张力,以及更广泛的 AI 竞赛,正推动公司把机器人供应链与制造搬回本国。除了少数例外——比如 Boston Dynamics 在马萨诸塞州制造人形与四足机器人——机器人制造与供应链的主体仍经过中国。Unitree Robotics 提交上市材料表明,机器人硬件制造商可以是可行的商业模式。这留下了巨大空间:不仅要在 FATP(最终组装、测试与包装)上建立国内产能,还要在执行器、电池等核心部件上建立国内产能。
- 执行器(Actuators): 执行器很重要,它们使运动成为可能。Sangbae Kim 教授开创的本体感觉驱动(proprioceptive actuation),帮助运动控制取得成功。但我们仍看到局限,比如中国一场人形马拉松上电机必须冷却。执行器对灵巧性同样极其重要。人类的手有 22 个自由度,要做出机器人等价物,意味着要把又小又强的电机塞进非常紧的空间。Origami Robotics 在博客 The Dexterity Deadlock 中解释了这一挑战。机器人将极大地受益于扭矩更大、更轻、功耗更低的执行器。
- 触觉与力传感器(Tactile & Force Sensors): 要在类人灵巧性上取得成功,我们需要「采集正确的数据,并学会正确的事情」,Rodney Brooks 在文章 Why Today’s Humanoids Won’t Learn Dexterity 中写道。正确的数据必须包括触觉与力觉。人手就是证明:它有约 17,000 个机械感受器(mechanoreceptors),并在各个关节上注册力,以控制运动。Eka 的视觉-力-动作模型表明,引入力觉传感,能让机器人完成此前被认为不可能的任务,比如拧灯泡。触觉反馈可以进一步增强灵巧性。触觉传感可以通过视觉、压力、电容等方式完成。确定最适合学习的传感器模态,以及能在部署中耐受使用的稳健传感器设计,是一个有意思的机会。
软件工具(Software Tooling)
MLOps 成为机器学习工程师采集数据、训练模型并可靠部署的关键基础设施。用于调优、评估和部署机器人的技术栈正在快速演进:在位者如 ROS,创业公司如 Foxglove,在栈的不同层上创新。我们看到进一步构建的机会,尤其是在微调、推理和护栏(guardrails)层。
- 微调(Fine-tuning): 用任务特定数据集、失败模式及其对应的恢复案例,持续更新并优化模型的工具。
- 评估与基准测试(Evaluations & Benchmarking): 衡量模型或机器人在给定任务上表现如何、并测试安全性的框架。
- 回放与测试(Replay & Testing): 帮助在仿真环境中虚拟测试机器人,然后回放日志以抓住 bug、修复失败的工具。
- 监控与可观测性(Monitoring & Observability): 在生产中流式传输、可视化并记录传感器数据与关节位姿的工具,以便快速发现问题并修复。
- 护栏(Guardrails): 用于实时安全与安保检查,强制执行规则,确保功能安全、可靠。
- 推理(Inference): 为了在云端以及直接在边缘硬件上以最小延迟和功耗服务模型,而构建的优化与混合运行时引擎。
- 机队编排(Fleet Orchestration): 机队编排层充当软件「控制平面」(control plane),使运营方能够部署、管理并监控现场的多台机器人。这一层让不同机器人本体(embodiments)易于集成,也便于理解并微调它们的能力。通过把高层目标变成可操作事项,这一层把复杂目标拆成子任务,分配给合适的机器人,并协调机队之间的实时执行与数据共享。
我们预期,那些能降低整栈摩擦、帮助机器人走向生产的技术,将在未来十年蓬勃发展。如果你正在这里建造,我们希望听到你的声音。
本文由 RecodeX 编译自 SandHill.io #299 推荐阅读,原文链接与作者见文首;原文版权归原作者所有,译文仅供学习交流,如有异议请联系我们处理。
