原创报道
2026.07.26 16:17 约 12 分钟 机器人 1.2万 阅读

眸深智能获近亿元Pre-A轮追加:差异化动作路径能否突围具身智能赛道?

项目速览
项目名称 眸深智能
融资轮次 Pre-A轮追加
融资金额 近亿元
投资方 瑾悦投资, 创合汇资本, 徐汇资本

让一台人形机器人在无人干预下稳定完成从地面捡起矿泉水瓶这一连贯动作,需要什么?主流方案通常是在海量真机遥操作数据上训练视觉-语言-动作(VLA)模型,将动作当作感知理解的末端输出。问题在于,这类模型生成的动作仍趋向片段化与僵硬,且每换一种机器人本体或作业环境,几乎要重新采集一遍成本高昂的动作数据。在通用具身大脑集体奔着VLA范式疾跑的2026年,一家公司却把赌注押在了一个更底层的命题上——如果将“动作”本身定义为机器人的原生语言,通用执行层的天花板能否被彻底打开?

近日,这家名为眸深智能(Motion Brain)的初创公司正式披露,已完成近亿元Pre-A轮追加融资,投资方包括瑾悦投资、创合汇资本、老股东徐汇资本,以及未具名的中国头部物业服务公司和香港财团。本轮追加融资距离其2026年5月那笔3亿元的Pre-A轮融资仅隔两个月。据公司透露,Pre-A+轮近5亿元的融资交割亦在推进中,公司近半年估值增长超10倍。

这家成立刚满一年半的公司,正试图向市场证明,以动作为轴心的差异化技术路线,不仅能避开VLA路径的高数据成本深坑,更可能在端侧算力与国产芯片生态上建立起难以复制的工程壁垒。但其营收成色、客户落地深度以及估值骤升背后的假设,尚待冷静拆解。

公司 轮次 金额 投资方 总部 创始人 官网
眸深智能(Motion Brain) Pre-A轮追加 近亿元 瑾悦投资、创合汇资本、徐汇资本,以及未具名的中国头部物业服务公司、香港财团 未披露 陈涛、张益民、穆泽林 未披露

把动作变成Token,眸深用“世界动作模型”推开VLA的另一扇门

具身智能行业正处在技术路线的十字路口。多数初创公司和科技巨头在视觉-语言模型(VLM)基础上增加动作输出模块,即VLA范式,试图让机器人通过对图像和语言指令的理解来推导出动作序列。这条路逻辑直接,却面临一个顽固瓶颈:动作生成质量严重受制于真机数据规模,采集成本居高不下,且跨本体泛化困难。即便是最头部的团队,在为不同形态的机器人适配同一套VLA模型时,也可能面临从头采集数据的窘境。

眸深智能选择的方向截然不同。它核心的研究起点是:如果让AI直接学习“动作语言”本身的规律,而非将其视为语言与视觉的附属输出,会发生什么?据公司创始人、CEO穆泽林对硬氪描述,团队早期通过几十人手工标注数万帧人体姿态,将连续动作离散化为约3000个“动作基元”或称动作Token,类似汉字中3000个常用字,组合后能覆盖人类绝大部分行为。这直接指向了该公司的核心产品——基于世界动作模型(STI-WM)的端侧自进化具身大脑。

这种原子化的动作定义方式,本质上是为机器人的运动控制建立一套完整的、可组合的基础语义单元。每一个动作基元都可能对应着人体或机器人关节在特定时间片段内的姿态变化模式,而3000个基元的组合空间理论上可以覆盖从日常生活到工业操作中绝大多数重复性或组合性动作。不过,这套体系在面对高度复杂的精细操作或需要极端柔顺性的长尾任务时,其基元库的覆盖度和组合表达能力仍有待大规模、多场景的第三方评测来验证。

公开论文记录显示,团队在全球率先提出将动作映射到隐空间(Latent Space)并引入扩散模型(MLD),于2023年9月发布MotionGPT,这是全球首个把动作做成Token的具身大模型。其逻辑类似大语言模型通过预测下一个文本Token来生成连贯语句,MotionGPT则预测下一个动作Token来生成自然连贯的复杂行为序列。穆泽林在采访中解释:“我们可以把动作理解为‘数字化的姿态’,就像小人书连续翻页形成动画。让模型学习动作间的关联,比如喝水时手会抬到嘴边,抱胸后大概率会展开手臂,就能实现端到端的动作生成,且支持文本、图片、3D点云到动作的多模态转化。”

这种将动作作为一等建模对象的思路,使模型具备了Zero-Shot(零样本)泛化能力——穆泽林举例称,机器人学过拿矿泉水瓶,未学过拿手机,仍可通过动作序列迁移完成约80%的准确度,剩余部分靠少量后训练或强化学习校准。但是,剩余20%的准确度缺口在工业应用中是否属于可接受范围,取决于具体场景对失败率的要求。在容错率极低的精密装配任务中,20%的初始失败率可能意味着大量人工干预,这会反过来侵蚀动作Token体系所宣称的效率优势。

依赖真机数据减九成,训练配方从“重采集”转向“重观察”

具身智能对高质量真机数据的饥渴,是整个行业不敢明言的成本痛点。据公开信息,某些头部公司构建单个通用抓取技能所需的有效真机演示段落,背后是数千小时的人工遥操作和硬件磨损成本。如果这些成本不能通过模型泛化能力的大幅跃升来均摊,通用具身大脑的经济模型将长期停留在实验室阶段。

眸深智能在2026年发布的第七代模型STI-WM(时空一体世界动作模型),试图用一套全新训练配方破解这一困局。据公司披露,该模型基于MotionGPT建立的动作词典,将训练数据构成重塑为“80%互联网视频+10%动捕数据+10%真机数据”。其逻辑是:从百万小时级别的互联网视频(影视剧、监控、Vlog等)中提取符合物理先验的动作因果规律,用少量高精度动作捕捉数据校准生物力学特性,最后仅需10%的真机数据完成真实物理环境下的闭环对齐。

这种从“重采集”到“重观察”的范式转移,如果被证明可规模化迁移,可能意味着机器人技能开发的经济模型发生根本性改变。公司声称,这种范式将真机数据需求降低了90%,同时动作准确度提升至99%。不过,互联网视频中的动作序列虽然丰富,却缺乏与真实物理世界的力觉和触觉反馈的对应关系,模型在纯视觉动作学习中所推断出的物理规律,是否能在机器人的实时力矩控制和柔顺交互中保持一致性,仍需在更多样化的真实机器人平台上获得验证。

此外,团队在今年3月提出的T²MB(Task*Task Motion Brain)机制,让端侧模型在部署后无需回传数据就能基于本地交互自我进化,任务执行准确度最高可提升25%,直接解决了传统机器人落地后遇bug必须返厂升级的行业痛点。这一机制在离线状态下的自进化能力,可能对工业客户部署在数据安全敏感环境中的机器人具有重要吸引力,但该机制在真实生产环境中长期运行的漂移率与失效模式,公司尚未公开详细数据。

推理成本从20万压至1万,端侧算力成为真实护城河

如果说动作模型是眸深智能的理论长板,那么把模型送入机器人本体的端侧推理成本,才构成商业化落地的真正闸门。穆泽林对硬氪承认,具身大脑能否规模化,端侧算力成本是关键。目前市面上一台搭载完整VLA大脑的人形机器人,单是大脑模块的硬件成本就可能高达20万元,这严重压缩了本体厂商的利润空间和终端客户的采购意愿。

眸深智能从第一代模型起就同步推进模型压缩与国产芯片适配两件事。在模型工程化层面,团队通过模型蒸馏、冗余参数压缩等手段,将千亿参数级模型压缩至百亿级别,在具体场景中参数量降低约75%,端侧推理延迟从约200毫秒大幅压缩至10毫秒左右。在芯片适配层面,团队同步打通了海思(昇腾310/910)、地平线、燧原(燧原S60)等国产芯片平台。据公司给出的结果,这套软硬协同打法将模型端侧推理成本从此前行业常见的约20万元直接拉低至1万元量级,大脑续航时间提升近10倍。

这组数据构成了投资人对该公司“工程化能力”的主要信心来源。与多数走VLA路线的团队不同,眸深智能从未将端侧部署视为模型训练之后的第二步骤,而是从架构设计的初始阶段就将运算复杂度、内存带宽和功耗预算等嵌入式约束纳入优化目标。这种软硬协同的设计哲学,可能是其能在保持动作生成质量不降的前提下实现百亿参数端侧推理的关键。但必须指出,在国产芯片的稀疏算力集群上部署百亿参数模型并保持精度不掉点,是行业公认的高难度动作,且不同批次的国产芯片一致性、驱动生态稳定性仍存变数。穆泽林对此的回应是,团队中拥有海思、英特尔、英伟达三大芯片巨头背景的技术人员,是国内少数具备算子级适配能力的具身大模型团队,下半年目标是攻克千卡级国产集群纯自主训练。

当国产GPU成为必选项,投资人为何赌这笔“芯片基因”

本轮追加融资的投资方组合折射出眸深智能叙事中隐蔽却极具溢价空间的一环——国产算力可控。瑾悦投资作为多家上市公司联合打造的产业投资平台,徐汇资本作为上海地方国资的代表,以及未具名的头部物业服务公司和香港财团,这组股东的集体站位可能暗示着,眸深智能的技术路线已被部分产业资本和国资视为国产替代浪潮下的一枚关键棋子。

穆泽林在采访中直言:“长期来看,国产GPU是必然选择,英伟达卡会越来越贵、供应受限。”这一论断对于熟悉中国AI基础设施现状的投资者而言并无悬念,但真正令产业资本和国资基金下定决心押注的,是他后面一句:“我们的核心优势是‘懂芯片’,我们是国内唯一具备算子级适配能力的具身大模型团队。”

国内具身智能企业当前普遍的做法是先在英伟达芯片上训练模型,再向国产芯片移植适配,这一过程常伴随20%-40%的性能损耗和大量兼容性调试。眸深智能意图跳出这一定式,未来在模型训练与推理全流程中基于国产算力芯片原生开发。对投资方徐汇资本、瑾悦投资等而言,这同时契合了供应链安全、上海本地人工智能产业高地集聚以及信创替代的多重诉求。但从另一个角度看,这一战略押注的兑现时间表高度依赖于国产GPU在制程迭代、软件生态成熟度以及批量一致性方面的进展。如果计算效率的绝对性能长期不足以媲美英伟达最新架构,这一定位的市场窗口何时正式开启,尚系于国产GPU制程与软件生态的双重进展。

千万级营收与模糊客户:B2B落地速度领先,但订单质量待检视

眸深智能是目前国内少数已获得规模化营收的具身大脑公司,至少在自我披露的财务口径上是如此。穆泽林透露,公司2025年审计回款收入达千万元级别,2026年上半年营收攀升至3000万元,并预计全年将超过5000万元。这些数据未经独立审计验证,其确认为合同负债或真实现金回款的比例,外人无从知晓。在具身智能行业普遍仍处于商业化早期、多数初创公司尚未获得实质性外部收入的背景下,这份营收规模若属实,确实意味着眸深智能在B2B场景下具备一定的交付节奏。

公开披露的客户名单同样保持克制而略显模糊:2026年第一季度,公司已向某港股上市物业公司、某A股上市环卫龙头交付机器人相关产品;正在推进与某头部连锁零售集团、某头部白色家电工厂的人形机器人落地场景研发。物业和环卫这两个场景,虽然具备相对标准化的移动和作业流程,对机器人导航和基础操作的需求明确,但其付费能力天花板以及采购决策周期较长的问题,可能构成眸深智能从千万级收入向亿元级收入跃迁的现实阻力。而在零售和家电工厂场景中,人形机器人的落地复杂度更高,从场景调研、本体适配到产线部署试运行的周期可能超过一年,这意味着该部分营收贡献的时间节点很可能集中在2027年以后。如果签约客户确为龙头,单笔订单金额具备一定规模想象空间,但物业和环卫场景的付费能力天花板,以及人形机器人场景的落地复杂周期,均构成营收预期的潜在风险。

技术被英伟达连续引用,却面临具身大脑的“一超多强”竞局

眸深智能的技术路线已在学术圈和产业巨头处获得某种间接背书。据公司披露,英伟达DAIR实验室在最新ARDY模型中援引了眸深智能的MLD与MotionGPT两项原创技术,这是近两年英伟达第三代动作模型对该公司技术路线的第四次引用。公司团队还获得了IJCAI 2025全球最佳论文奖,为近五年唯一获此奖项的中国大陆团队。这些学术和产业界的认可,可能为眸深智能在人才吸引和学术品牌建设上提供优势,但并非商业化成功的充分条件。

但从实验室认可到产业话语权,距离依然漫长。具身智能大脑赛道已经涌入大量手握数亿融资的初创公司,以及自带本体与场景优势的机器人整机厂。眸深智能尚未公开披露直接可比的竞争对手详细名单,但按照穆泽林对产业终局的预判,通用大脑领域大概率形成“一超多强”格局,研发门槛极高,国内具备完整研发能力的团队屈指可数。这一论断的正确性,很大程度取决于眸深智能能否在核心本体厂商的下一代产品中稳固占据“大脑供应商”角色。若本体厂商加大自研大脑的投入,或出现另一家同样以动作模型为突防口的追赶者,公司技术先发期的红利将遭受严重挤压。此外,如果大型科技公司决定全面入局具身大脑并将其捆绑在自家机器人本体或云服务生态中,独立大脑供应商的市场空间也可能被结构性压缩。

超十倍估值跃迁承载的三大待验证假设

短短两个月内估值涨幅超10倍,Pre-A+轮5亿融资接力,眸深智能的资本节奏已接近具身智能赛道第一梯队。但任何估值的非线性扩张,最终都需要核心假设的持续正向验证来消化。梳理其公开信息与高管表态,至少有三大假设悬在头顶。

其一,动作Token体系的规模泛化边界。3000个动作基元覆盖人类日常行为的说法令人着迷,但工业作业、精细操作中是否存在大量无法被基础Token组合覆盖的长尾姿态,目前缺乏公开测评结果。一旦实际部署中暴露出显著的基元库缺口,就需要重新标注和追加训练,这可能打破其宣称的“两周适配一个本体”的交付节奏。其二,国产芯片千卡级训练的工程达成时间表。公司下半年攻关千卡国产集群训练,若进度不及预期,原生国产化的商业化故事将被迫打折扣,而投资者对于“国产算力第一大脑”的估值溢价也将快速收敛。其三,物业与环卫客户的真实复购率。B2B项目制收入初期常伴随头部客户的首批试点订单,但能否从千万级跨越到亿元级经常性收入,考验的不是单个场景的成功,而是跨本体的快速适配能力是否如其所声称的“两周完成”——这项指标目前仅来自公司单方面陈述。在收入结构从项目制向软件授权订阅制转型的过程中,客户数量和场景版图的质变,将成为衡量其长期商业价值的关键标尺。

RecodeX 极客视点:眸深智能的Pre-A轮追加融资,表面上是对“世界动作模型”差异化路线的再次肯定,实则深度系于国产算力自主可控的叙事溢价和端侧工程化压缩能力的稀缺性。在具身大脑尚未定型出通用标准的窗口期,动作Token体系若能持续跑通更多异构本体和长尾任务,眸深可能抢占宝贵的执行层标准制定权;反之,如果一个由互联网视频喂养的动作基元库证明不了在真实产线上的鲁棒性,它将只是一张华丽的学术底牌。而这场豪赌的下半场,将在千卡国产芯片集群的训练效果和物业环卫客户的真金复购中,迎来第一次客观打分。

RECODEX PARTNERSHIP
你的项目,下一篇值得报道
RecodeX 为 AI×Web3 早期项目提供从深度报道到融资撮合的全链路服务。三档方案,按阶段匹配。