潜界科技(LatentVerse)完成数亿元种子轮融资:世界动作模型成新热点,统一触觉动作模型如何突围?
一个机械臂在桌面上方悬停,它的任务只是把一个不锈钢杯子放进托盘。视觉信号告诉它杯子的坐标,它准确移动到位置,下降、抓握、抬起——杯子滑脱了。再来一次,依然在最后几毫米失败。
这不是电机精度的问题,也不是训练数据不够。摄像头可以回答“杯子在哪里”,却回答不了“指尖是否打滑”。在具身智能的链条上,触觉一度是被结构性地忽略的环节。当行业沉迷于用更强的大语言模型提升机器人的“理解力”时,真实世界用一次次滑落的杯子提醒从业者:缺少触觉的闭环,动作永远在猜测。
正是在这个矛盾的交叉地带,一家成立不到两个月的公司完成了数亿元种子轮融资。8月11日,具身基座模型公司潜界科技(LatentVerse)宣布获得来自高瓴创投、清流资本、英诺基金,以及智元、星动纪元等产业资本联合注资。
| 项目 | 内容 |
|---|---|
| 公司 | 潜界科技(LatentVerse) |
| 轮次 | 种子轮 |
| 金额 | 数亿元 |
| 投资方 | 高瓴创投 |
| 清流资本 | |
| 英诺基金 | |
| 智元 | |
| 星动纪元 | |
| 总部 | 未披露 |
| 创始人 | 胡钰承 |
| 官网 | https://talentverse.com/ |
| 成立时间 | 2026年5月 |
触觉为何成为具身智能的“最后短板”
如果把当前主流的具身智能基础模型摊开来看,视觉-语言-动作(VLA)架构几乎占据了统治地位。这条路线的逻辑足够直接:用大语言模型理解指令、用视觉模型感知环境、用动作模型输出控制指令。当机器人的能力被框定在“桌面整理”或“固定姿态抓取”这类封闭场景时,VLA表现尚可。
问题出在向外走的时候。一旦进入非结构化环境、需要连续操作或触碰陌生物体,纯视觉判断的弱点就会暴露——照明变化、遮挡、透明材质、可变形物体,这些在工厂产线上被极力规避的变量,恰恰是真实世界的底色。而触觉,作为唯一能在接触面持续提供力反馈、滑移检测和形变信息的高频模态,长期处于基础模型建模之外,原因并不复杂:数据难采集、表征难统一、时序融合难做。
潜界科技提出的UTAM(Unified Tactile Action Model),正是试图把触觉从边缘补丁变成架构的原生组成部分。根据团队公开的研究路线,UTAM整合了四个模块:视觉语言模块负责理解语义任务,世界模型模块预测动作可能引发的状态变化,动作模块生成控制信号,触觉模块则根据接触力、滑移和物体形变进行高频修正。这种设计的实质,是让模型在做动作之前、之中、之后都持续接收来自接触面的反馈,而非像大多数VLA系统那样只依赖动作执行前的视觉快照。
从技术演进看,该团队此前的研究覆盖了DP3、HiRT、VPP、BagelVLA和UAM等项目,路线大致跨越了从视觉-动作(VA)到视觉-语言-动作(VLA),再到世界动作模型(WAM),最终走向统一模型。其中,DP3较早将紧凑3D视觉表征引入扩散策略,在机器人操作的泛化学习上取得了可见的效果。这些研究为UTAM提供了架构层面的前置积累,但将触觉提高到与视觉语言并列的核心地位,是此前论文中尚未系统验证的方向。
“嫡系”团队与一套论文尚未直面的工程挑战
潜界科技的团队配置在具身智能圈子里形成了一个值得关注的切面。创始人胡钰承是清华大学交叉信息研究院博士生,师从星动纪元创始人陈建宇,曾在字节跳动Seed参与具身智能基座模型研究。据公开信息,包括创始人在内的三位核心成员分属两位“伯克利归国四子”的门下——另两位成员分别师从陈建宇和破壳机器人创始人许华哲。团队成员还来自北京大学、南洋理工大学,以及阿里Qwen、小米等团队。
这种基因带来的一个直接效应是融资速度。高瓴创投在公司成立之前就与核心成员有过接触,融资启动后迅速成为第一轮投资人;英诺天使基金在沟通当天即给出TS。多位资方人士的信息显示,高瓴重仓该项目的负责人正是当年主导投资Minimax的合伙人。在不到两个月内完成数亿元种子轮,且有多家一线VC已锁定下一轮融资,这种节奏在具身智能赛道并非没有先例,但放在一家2026年5月才成立的公司身上,足以说明资本对“清华叉院系”团队的溢价。这种溢价不仅源于学术背景本身,也可能折射出投资机构对具身智能底层技术路线的焦虑——在行业共识远未收敛的阶段,押注一支有连续研究产出记录的团队,某种程度上是在用人的确定性对冲技术路径的不确定性。
不过,从论文作者到公司创始人的身份转换,UTAM要跨越的并不只是工程化鸿沟。当前具身基础模型的训练依赖大规模、高质量的多模态数据,而触觉数据的获取天然比视觉数据昂贵得多——它需要真实硬件在真实环境中产生接触,而非从互联网爬取。潜界科技已宣布完成UTAM多模态数据基础设施和训练管线建设,并开始推进各专家模块的联合训练,但并未披露数据规模、任务覆盖度和机器人本体类型。这意味着外界暂时无法判断其数据体系究竟能支撑多大程度的泛化。此外,团队此前积累的项目从DP3到UAM,主要验证的是视觉、语言和动作维度的能力,触觉模块在整个研究谱系中仍处于相对早期的验证阶段,将其提升至基座模型核心组件所面临的数据基础设施挑战,可能是这轮融资后最硬核的投入方向之一。
世界动作模型升温,但路径远未收敛
潜界科技进入的是一个仍在剧烈演化的赛道。今年以来,世界动作模型作为一个新热点迅速升温。英伟达推出的DreamZero通过联合预测未来视频与机器人动作,让模型同时学习环境变化和控制策略,在真实机器人实验中展现出对未见过任务的泛化能力。英伟达近期已将其同VPP、LingBot-VA等项目纳入WAM技术演进脉络,显示出对这一方向的战略性押注。
但同一份来自英伟达的分析也坦承,WAM虽然有望提升机器人对新任务的泛化,空间物理理解以及跨不同机器人本体迁移仍是未决问题。这就给潜界科技的UTAM提出了一个更高的标准:它不仅要证明统一触觉动作模型在单一本体上的能力,更要跨过不同机械臂、灵巧手和传感器配置带来的域迁移障碍。触觉信号的引入虽然可能增强模型对接触状态的理解,但却在迁移层面增加了一个新的变量维度——不同本体的触觉传感器在分辨率、采样率和安装位置上差异显著,这意味着UTAM的泛化验证难度可能比纯VLA或WAM路线更高。
另一条对比线来自Figure开发的Helix系统,采用“慢速理解+快速控制”的双系统架构——一个负责高层语义推理,另一个负责毫秒级动作执行。这种分离式设计的隐含假设是:高层理解不需要触觉信号,触觉只属于底层控制。而潜界科技的路径恰恰相反,它试图在模型架构内部打通多模态之间的壁垒,让触觉信号参与从任务理解到动作生成的全链路。两种路线孰优孰劣,在目前阶段没有任何实证回答,但行业竞争的实质正在于此:无论谁的后验更优,赢得足够的数据飞轮和验证场景的公司,将率先定义具身基础模型的架构范式。值得留意的是,Helix的双系统方案在实际部署中可能更容易在现有机器人硬件上分阶段落地,而UTAM的全模态一体化设计如果成功,其架构优势在于减少了模块间的信息损耗和延迟,但这也意味着对训练数据和算力的需求可能更大,两种路径面临的风险结构并不相同。
资本结构传递的信号:产业资本入局,但不等于消除风险
潜界科技的本轮投资方包含了智元和星动纪元两家机器人本体公司,这个资本结构比融资金额本身更具解读价值。智元是国内人形机器人的头部创业公司,星动纪元同样是具身智能本体赛道的主要玩家。二者以真金白银进入一家具身基座模型公司的种子轮,而非仅仅签署战略合作备忘录,说明本体厂商对“模型决定硬件代际”的判断正在加重。
这是产业资本在具身智能产业链上的一次纵向布局。对于潜界科技而言,智元和星动纪元的进入可以带来宝贵的数据采集环境和真实验证场景,但也埋下了一个需要长期观测的变量:两家本体厂商之间本身存在竞争关系,潜界科技未来如何平衡来自不同本体客户的诉求,能否保持模型的多本体兼容性而不被绑定,这在其规模化的进程中会逐步成为显性问题。从更为长远的角度看,如果未来有更多本体厂商希望接入UTAM,但发现模型已深度适配股东方的硬件,可能会对引入产生顾虑,这或许会成为潜界科技在商业化阶段需要主动管理的生态风险。
高瓴创投的快速决策则释放了另一层信号。当年投资Minimax的负责人在潜界科技成立前就与团队接洽,这一背景暗示了资本方对“大模型时代底层架构公司”具备长周期认知——具身智能基础模型与大语言模型在训练范式、数据飞轮和生态建设上的相似性,正在促使基金以类似的逻辑进行早期布局。但语言的归语言,物理世界并不会像文字世界那样慷慨地提供低成本试错空间。一个机器人在真实厨房中摔倒的代价,远比一个聊天机器人输出幻觉内容的代价沉重。这种差异意味着,投资机构对具身基座模型公司的耐心窗口和容错空间可能需要做更保守的估计,当前融资的高溢价可以理解为对技术潜力的定价,但并不自动转化为对物理验证失败的豁免。
“数亿元”种子轮的资金去向,透露公司的优先级排序
潜界科技披露的资金用途是:模型研发、多模态具身数据体系、训练基础设施和真实机器人验证。四个方向的顺序本身构成了一个优先级声明。
排在首位的是模型研发。UTAM目前虽然已公开部分前置项目的论文,但作为一个统一触觉动作基座模型的整体能力尚未在具有统计学意义的基准测试中得到量化评估。将最大比重的资金持续投入模型开发,是守住技术壁垒的核心逻辑。其次是数据体系。多模态具身数据的采集成本极高,一支具备多传感通道、覆盖多种操作任务的真实机器人数据集,在市场上几乎不存在现成的开源选项。潜界科技如果希望在触觉数据处理上建立比较优势,自建数据管线和标注能力是绕不开的投入。训练基础设施的排序进一步表明,公司预期模型参数量和数据规模将快速增长,可能需要构建或租赁专门服务于多模态联合训练的计算环境。触觉数据的高频特性意味着单位时间产生的数据量可能远超纯视觉方案,这对存储、预处理和训练框架都会提出额外的工程需求。
最后,真实机器人验证被明确列出,意味着潜界科技并不打算止步于模拟环境中的指标提升。将模型在真实硬件上运行、在未排练场景下测试,是弥合论文成果与产品能力之间裂缝的关键环节。四个方向之间存在相互依赖关系——没有足够的数据体系和训练基础设施,模型研发的迭代速度会受限;没有真实机器人验证,模型能力的上限和边界无法被确立。从资金分配的顺序可以推测,团队希望在相对早期就将触觉数据的规模化采集和真实场景验证纳入核心流程,而不是等到模型成型后再去补课。
从技术demo到商业化闭环,UTAM还有多少“未验证假设”
潜界科技对外传达的叙事中,UTAM的愿景形态已经相当清晰,但这与商业化之间还隔着一个由未经验证的假设构成的灰色区域。编辑依据现有信息梳理出至少三个关键问题。
其一,触觉信号的统一表征是否具有跨任务的通用性。抓取一个杯子和旋开一个瓶盖,所需的触觉反馈在时间尺度、频率分布和接触面特性上差异极大。如果一个模型需要为不同任务设计不同的触觉编码器,那么“统一”的意义将被大幅削弱。目前潜界科技未披露UTAM在跨任务、跨物体条件下的泛化指标。
其二,触觉数据的经济性难题如何从工程层面突破。传感器本身不是最大的成本卡点——难点在于每一次有效触觉数据采集都需要有真实机器人实际接触物体,这意味着数据获取速度受限于物理时间,无法像互联网视觉数据那样并行扩容。潜界科技是否掌握了某种规模化的触觉数据获取方法,直接影响模型迭代速度与商业节奏。如果无法找到依赖仿真至真实迁移或自监督学习等方法来降低对真实接触数据的绝对需求量,触觉优先的路线可能在数据飞轮建立之前就遇到经济性瓶颈。
其三,下游客户对“触觉优先”架构的付费意愿尚不明朗。当前机器人行业的采购决策主要被本体性能、视觉感知和运动控制能力所左右,触觉尚未成为客户列在需求列表前排的硬指标。如果UTAM在触觉整合上带来的性能优势主要体现在边缘案例——比如异常滑脱、复杂材质接触——那么教育市场、证明这些优势能转化为真实场景中可量化的可靠性提升,将是商业化的前置成本。这意味着潜界科技在技术验证之外,可能还需要构建一套能够清晰对比有无触觉条件下任务成功率和鲁棒性的评估体系,而这本身在行业内也尚未形成统一标准。
下一轮融资已经趋近,但真正的考验在硬件尺度
据公开信息,潜界科技的下一轮融资已被多家一线VC锁定,这意味着公司在资金层面的生存窗口远未关闭,甚至可能比绝大多数种子轮公司更宽裕。然而,融资速度与产品速度之间的错配正是赛道过热时最值得警惕的风险。具身智能历经过几轮热度周期,资本的高期待往往倾向于把技术验证期压缩到极限,而物理世界对模型的压力测试并不会因为资本到位的速度而一同加速。
潜界科技需要回答的核心问题在创办的最初几个月里不会变成财务报表上的危机,但它将在今后一年左右逐步浮现:UTAM能否在多本体、多场景、多任务的条件下展现出超过主流VLA路线的通用性;触觉数据处理的经济成本能否压缩到足以支撑商业闭环;以及,当产业资本与财务资本同时押注,公司能否维持住模型的跨平台开放性而不走向绑定。这些不是一家公司独自面对的问题,而是整个具身基座模型赛道在跨越从实验室到真实世界的鸿沟时,必须集体作答的命题。
RecodeX 极客视:把触觉提升到与视觉和语言并列的基座地位,是一个在学术上正确、在工程上极度昂贵的信仰。潜界科技拿到的数亿元种子轮,本质上就是为这个信仰提前支付的验证成本。真正的竞赛不在论文引用量,而在于谁能先把“指尖不滑”变成规模化可复现的、不同本体都能解锁的能力。一旦做到,触觉就不再是一个被忽略的传感器通道,而将成为下一代机器人说明书中那条不可妥协的基线。