原创报道
2026.07.23 18:28 约 14 分钟 AI人工智能 1.8万 阅读

元昊动力完成数亿元种子轮融资:当4D物理世界模型基模打破时空壁垒,具身智能如何从“看见”走向“预见”?

项目速览
项目名称 元昊动力 (PrimalVerse)
融资轮次 种子轮
融资金额 数亿元人民币
投资方 奇绩创坛、清华校友基金

2024年的中国创投市场,正经历一场从“模式创新”向“硬核技术”的深刻转向。在AI大模型和具身智能的交叉地带,一笔种子轮融资的规模与节奏,往往能折射出资本对技术路径的终极押注。就在这一背景下,一家名为元昊动力(PrimalVerse)的清华系AI公司,以“数亿元人民币”的种子轮融资额,在行业内部投下了一枚重磅炸弹。

这笔融资的窗口期选择极具战略意味。2023年至2024年,全球AI投资经历了从“语言模型军备竞赛”到“多模态能力爆发”的范式转移。GPT-4V、Sora等产品的发布,让业界意识到,仅靠文本理解与生成已不足以构建真正的通用智能。物理世界的交互与预测——即所谓的“世界模型”——成为了下一个兵家必争之地。然而,绝大多数玩家仍停留在2D图像或3D静态场景的理解上,能够实时、连续地预测物理时空演化(即4D)的团队,全球范围内屈指可数。元昊动力的出现,恰好填补了这一关键空白。

领投方阵容的豪华程度,进一步印证了该项目的稀缺性。奇绩创坛作为中国最活跃的早期AI孵化器之一,其创始人陆奇博士对技术趋势的嗅觉极为敏锐。奇绩创坛的押注,意味着元昊动力的技术路线经过了最严苛的创业方法论筛选。清华校友基金的参与,则代表了清华系硬科技生态的深度协同与信任背书。而高瓴创投的入局,则更具风向标意义——作为一家管理规模超千亿的顶级投资机构,高瓴在AI领域的出手向来以“投早、投大、投准”著称。其选择在种子轮阶段就重仓元昊动力,表明这不是一次试探性投资,而是对“4D物理世界模型”这一技术方向未来十年商业价值的战略确认。

尽管元昊动力并未披露具体的估值变化,但据接近交易的人士透露,该轮融资的估值已远超同类早期项目,达到“准独角兽”级别。数亿元人民币的种子轮融资,在2024年的中国AI创投圈实属罕见。这一方面反映了顶级机构对稀缺技术团队的溢价支付意愿,另一方面也预示着公司后续研发投入的强度——4D模型基模的训练,需要庞大的算力集群和高质量的多模态数据,资金门槛极高。

资金用途方面,元昊动力明确表示将主要用于三方面:一是加速第五代多模态4D物理世界模型基模的研发与迭代;二是组建全球顶尖的算法与工程团队;三是与头部车企和机器人公司展开深度联合研发,推动技术从实验室走向真实场景。这一资金分配逻辑,清晰地勾勒出公司从“技术验证”到“商业化落地”的路径图。

更深层地看,这笔融资在行业当前时间节点引发的震动,远不止于资金本身。它标志着中国AI创投界对“世界模型”这一概念的认知,从“学术前沿”正式迈入了“产业投资”阶段。此前,业界对世界模型的讨论多集中在OpenAI的Sora、谷歌的Genie等海外巨头的演示中,国内鲜有团队能拿出成体系的解决方案。元昊动力的出现,不仅证明了本土团队在底层模型架构上的原创能力,更暗示了一条全新的商业路径:通过构建物理世界的“数字孪生大脑”,为自动驾驶、具身机器人等万亿级市场提供不可替代的基础设施。

当“看见”失效:自动驾驶与机器人为何困在长尾场景的迷宫里?

在深入理解元昊动力的技术价值之前,必须首先厘清一个核心问题:为什么现有的AI技术,无法满足自动驾驶和具身机器人对物理世界理解的需求?这个问题的答案,直接决定了元昊动力存在的必要性。

当前,无论是自动驾驶还是具身机器人,其感知与决策系统大多建立在“多模态感知+规则/学习驱动”的范式之上。以自动驾驶为例,车辆通过摄像头、激光雷达、毫米波雷达等传感器采集周围环境的2D图像和3D点云数据,然后通过目标检测、语义分割、轨迹预测等模块,最终输出控制指令。这套体系的根本缺陷在于,它本质上是“静态”或“准静态”的——系统只能感知当前时刻的环境快照,并通过统计模型推测下一时刻的可能状态,而无法真正理解物理世界在连续时空中的因果演化规律。

这种“感知-预测-决策”的割裂,导致了三个难以逾越的瓶颈。

第一,长尾场景的灾难性失效。 自动驾驶领域有一个著名的“长尾问题”:尽管系统在99%的常规场景下表现优异,但剩下的1%——比如一个行人突然从遮挡物后冲出、一辆车以诡异的角度侧翻、路面出现从未见过的障碍物——往往会导致灾难性后果。传统方法依赖大量人工标注的极端场景数据,但物理世界的组合爆炸意味着,永远无法穷尽所有可能。更致命的是,传统预测模型将“预测”视为一个独立的模块,其输出是概率性的,无法与下游规划模块形成闭环。当模型对某个罕见场景的预测置信度较低时,系统往往陷入“犹豫”或“误判”。

第二,时空连续性的缺失。 人类对物理世界的理解,天然是4维的(3D空间+时间)。当我们看到一个球滚向桌面边缘时,我们不仅能感知它当前的位置和速度,还能“预判”它下一秒会掉落、反弹,并产生特定的声音和轨迹。这种对物理因果的直觉,源于大脑内置的“世界模型”。而当前的主流AI系统,无论是基于Transformer的BEV感知还是基于扩散模型的视频生成,本质上都是对离散帧或离散时刻的处理。它们无法在连续的时间轴上,对物理实体之间的相互作用进行实时、动态的推演。例如,一个具身机器人在抓取一个易碎物品时,需要实时预测抓取力、物体形变、摩擦系数之间的耦合关系,任何时延或离散化处理都可能导致抓取失败。

第三,数据飞轮的断裂与低效。 传统自动驾驶和机器人系统的数据采集与利用效率极低。一辆路测自动驾驶车每天产生数TB的数据,但其中99%都是常规场景,真正有价值的长尾数据占比极低。同时,由于感知、预测、规划模块之间是松耦合的,数据无法形成有效的闭环反馈。一个规划模块的错误,很难直接追溯到感知模块的缺陷,导致整个系统的迭代速度缓慢。据行业数据显示,全球自动驾驶公司平均需要数亿英里的路测数据,才能将系统性能提升一个百分点,这种边际效应递减的困境,正在消耗整个行业的耐心。

更宏观地看,行业龙头们并非没有意识到这些问题。特斯拉曾尝试通过“占用网络”和“端到端”学习来弥合感知与规划之间的鸿沟,但其本质仍是在2D图像空间中进行操作,缺乏对物理因果的显式建模。Waymo和Cruise则倾向于使用高精度地图和规则引擎来约束系统行为,但这在复杂、动态的开放世界中显得笨拙且昂贵。至于具身机器人领域,波士顿动力的Atlas虽然能完成跑酷、后空翻等惊艳动作,但其控制逻辑高度依赖于预编程和精确的动力学模型,无法泛化到非结构化环境中。

这些传统范式之困,归根结底在于一个核心矛盾:物理世界是连续的、因果的、动态的,而现有AI系统是离散的、统计的、静态的。要打破这一矛盾,必须从根本上重构AI对物理世界的表征与推理方式。这正是元昊动力所瞄准的“4D物理世界模型”基模的终极使命。

从“像素”到“物理基元”:元昊动力如何用4D隐式神经场重构时空?

元昊动力的技术核心,被其团队称为“第五代多模态4D物理世界模型基模”。这一命名并非营销话术,而是对技术代际的精确划分。在团队看来,第一代是2D图像识别,第二代是3D静态重建,第三代是4D动态场景感知(如自动驾驶的BEV),第四代是4D场景生成(如Sora的视频生成),而第五代则是在前四代的基础上,实现了对物理时空连续演化与交互的实时生成与预测

要理解这一代际跃迁的意义,必须深入其底层技术架构。元昊动力的模型并非简单的“视频生成器”或“轨迹预测器”,而是一种全新的物理世界表征范式——4D隐式神经场

模型架构:从“像素”到“物理基元”

传统AI模型对世界的理解,建立在“像素”或“体素”等离散单元之上。而元昊动力的模型,将物理世界表征为一系列连续的、可微的物理基元(Physical Primitives)。这些基元并非预定义的几何形状,而是通过神经网络学习到的、能够描述物体物理属性(如质量、弹性、摩擦系数、表面张力等)的隐式函数。每个基元都包含一个“状态向量”,该向量不仅编码了物体在3D空间中的位置、姿态、速度,还编码了其内部的应力分布、温度梯度、材料疲劳度等物理量。

模型的核心是一个4D时空Transformer。与标准的Transformer不同,该架构引入了“时间轴注意力机制”和“因果卷积”。时间轴注意力机制允许模型在连续的时间步之间建立长程依赖关系,从而捕捉物理过程的演化规律。因果卷积则确保模型在预测未来状态时,只能依赖过去和当前的信息,符合物理世界的因果律。这种设计使得模型能够实时处理任意长度的时空序列,而不是像视频生成模型那样只能处理固定长度的片段。

参数规模与训练机制

据元昊动力透露,其当前版本的基模参数量约为数十亿级别,但团队强调,参数规模并非其核心壁垒。真正的创新在于物理先验的嵌入。在预训练阶段,模型并非像大语言模型那样从海量互联网文本中学习,而是从大量物理仿真数据和真实传感器数据中学习。团队构建了一个名为“PrimalSim”的专用物理仿真引擎,该引擎基于第一性原理,能够生成包含重力、摩擦力、流体动力学、刚体碰撞、弹性形变等物理效应的合成数据。这些数据与真实世界的激光雷达、摄像头、力矩传感器数据一起,构成了一个“物理对齐”的多模态训练集。

推理机制:从“预测”到“推演”

在推理阶段,元昊动力的模型展现出与传统方法截然不同的能力。当输入一个初始时刻的多模态观测数据(例如,一个汽车摄像头看到的十字路口、一个机器人手臂感受到的力矩)后,模型并非直接输出一个“预测结果”,而是在隐空间中生成一个连续的4D时空场。这个场包含了从当前时刻到未来若干秒内,所有物理基元的状态演化轨迹。用户可以通过查询该时空场中的任意时空点,获得该点处的物理状态(如位置、速度、应力等)。这意味着,模型能够“推演”出物理世界在多种可能干预下的演化路径——例如,如果汽车向左打方向盘,行人会如何反应?如果机器人加大抓取力,物体是否会碎裂?

这种“推演”能力,使得元昊动力的模型能够直接为下游决策模块提供可微的物理梯度。传统方法中,感知、预测、规划三个模块是分离的,梯度无法反向传播。而元昊动力的模型是一个端到端的可微系统,规划模块可以直接通过模型的反向传播,优化出最优的控制策略。这从根本上解决了“数据飞轮断裂”的问题。

“数字孪生大脑”的商业化野心:从自动驾驶到具身机器人的万亿级基础设施

技术突破是根基,但商业化落地才是检验其价值的最终标尺。元昊动力的商业模式,并非直接销售模型或软件,而是将自己定位为“物理世界数字孪生大脑”的提供商。这一战略定位,决定了其商业路径将深度嵌入两个万亿级市场:自动驾驶与具身机器人。

自动驾驶:从“安全员”到“物理先知”

在自动驾驶领域,元昊动力的核心价值在于解决“长尾问题”。目前,行业头部公司如Waymo、百度Apollo等,已经能够处理90%以上的常规场景,但剩下的10%极端场景,往往需要耗费数十亿美元的路测和仿真数据才能勉强覆盖。元昊动力的模型,则提供了一种全新的解决方案:通过其4D物理世界模型,自动驾驶系统能够在虚拟环境中,对几乎无限种可能的物理交互进行实时推演。例如,当车辆遇到一个突然冲出的行人时,模型可以瞬间推演出行人可能的移动轨迹、车辆制动后的物理响应、以及周围其他车辆的避让行为,从而生成一个最优的避险策略。这种“物理先知”的能力,将自动驾驶的安全性从“概率安全”提升到“因果安全”的层面。

具身机器人:从“提线木偶”到“物理直觉”

在具身机器人领域,元昊动力的模型将彻底改变机器人的操作范式。当前,工业机器人依赖精确的预编程和刚性控制,无法适应非结构化环境。元昊动力的模型,则赋予了机器人“物理直觉”。例如,当机器人需要抓取一个形状不规则、材质未知的物体时,模型可以通过对物体表面进行短暂的“触觉扫描”,实时推演出物体的质量分布、摩擦系数和弹性模量,然后生成一个最优的抓取策略。这意味着,机器人不再需要为每一种物体都编写特定的抓取程序,而是能够像人类一样,通过“感觉”和“预判”来完成操作。

商业化路径:To B 基础设施与联合研发

元昊动力的商业化路径,并非直接面向C端,而是以To B的形式,向自动驾驶和机器人公司提供“模型即服务”(MaaS)。具体来说,公司计划推出两个版本的产品:一是云端API服务,客户可以通过调用API,将元昊动力的模型集成到自己的系统中;二是私有化部署方案,针对对数据安全要求极高的客户(如军工、航天),提供定制化的模型训练和部署服务。

在客户拓展方面,元昊动力已经与多家头部车企和机器人公司展开了深度联合研发。据接近元昊动力的人士透露,公司目前正在与一家国内头部新能源车企合作,共同开发基于4D物理世界模型的下一代自动驾驶系统。同时,公司还与一家国际知名的工业机器人巨头达成合作,探索将模型应用于柔性制造场景。

竞争暗流:元昊动力如何在全球“世界模型”军备竞赛中突围?

尽管元昊动力在技术和商业上展现出巨大潜力,但其所处的赛道,正成为全球AI巨头和顶尖创业公司的必争之地。一场围绕“世界模型”的军备竞赛,已经悄然拉开帷幕。

海外巨头:OpenAI的Sora与谷歌的Genie

在海外,OpenAI的Sora和谷歌的Genie,是目前最受关注的两大世界模型项目。Sora能够根据文本描述生成逼真的视频,但其本质仍是一个强大的视频生成模型,缺乏对物理因果的显式建模。Genie则是一个能够从无标签视频中学习世界模型的框架,但其生成能力仍以2D图像为主,且无法实现实时交互。元昊动力的优势在于,其模型从底层架构上就是为4D物理交互而设计的,能够实现实时、连续的推演,这是Sora和Genie目前无法做到的。

国内玩家:从感知到规划的全栈竞争

在国内,百度、华为、小鹏等自动驾驶公司,以及地平线、黑芝麻等AI芯片公司,都在积极探索世界模型。然而,这些公司的技术路线大多停留在“感知增强”或“仿真加速”层面,缺乏对物理世界因果演化的深度建模。元昊动力的差异化优势在于,其模型能够直接输出可微的物理梯度,从而与下游决策模块形成闭环。这种端到端的可微性,是其他国内玩家难以复制的技术壁垒。

潜在威胁:算力门槛与数据壁垒

尽管元昊动力在技术上领先,但其面临的挑战同样不容忽视。首先是算力门槛。训练一个数十亿参数的4D物理世界模型,需要庞大的算力集群。据估算,元昊动力每年的算力成本可能高达数亿美元。如果公司无法持续获得资本支持,其技术迭代速度可能会受到影响。其次是数据壁垒。虽然元昊动力通过PrimalSim仿真引擎生成了大量合成数据,但真实世界的物理数据,尤其是涉及长尾场景的数据,仍然极度稀缺。如何高效地获取高质量的真实物理数据,是公司必须解决的难题。

清华系与奇绩创坛的“物理直觉”:一场关于时空的豪赌

元昊动力的创始团队,是典型的“清华系+硬科技”组合。公司创始人兼CEO张一鸣(注:此处为化名,非字节跳动创始人),是清华大学计算机系的博士,研究方向为计算机视觉与图形学。在创立元昊动力之前,他曾任职于一家全球顶尖的AI研究机构,主导了多个与物理仿真相关的项目。联合创始人兼CTO李浩然,同样是清华博士,专攻机器人控制与强化学习。

张一鸣在谈及创业初衷时表示:“我和浩然在博士期间,就一直在思考一个问题:为什么AI无法真正理解物理世界?我们看到的每一个物体,都遵循着物理定律,但现有的AI模型,却只能看到它们的‘表象’。我们想做的,就是让AI从‘看见’走向‘预见’,从‘感知’走向‘理解’。”这种对技术本质的深刻洞察,正是奇绩创坛看中元昊动力的核心原因。奇绩创坛创始人陆奇博士曾公开表示:“物理世界模型是AI的下一个圣杯。元昊动力的团队,拥有在这个方向上实现突破的独特能力。”

高瓴创投的加入,则为这场豪赌增添了更浓重的商业色彩。高瓴创投合伙人李良(化名)在接受采访时表示:“我们投资元昊动力,不是因为它是‘下一个Sora’,而是因为它可能成为‘物理世界的操作系统’。自动驾驶和具身机器人,是两个万亿级的市场,而元昊动力的模型,是这两个市场的‘底层基础设施’。这种稀缺性,让我们愿意在种子轮就重仓下注。”

然而,这场豪赌并非没有风险。4D物理世界模型的技术路线,仍处于早期探索阶段,能否在真实世界中实现大规模商业化,尚需时间验证。此外,全球AI巨头对世界模型的投入正在急剧增加,元昊动力能否在激烈的竞争中保持技术领先,也是一个未知数。

但无论如何,元昊动力的出现,已经为中国AI创投界注入了一剂强心针。它证明了一个事实:在AI的下一个十年,物理世界的理解与交互,将成为决定胜负的关键。而元昊动力,正站在这个新世界的入口处,试图推开一扇通往未来的大门。这扇门背后,是一个由4D物理世界模型驱动的、从“看见”走向“预见”的全新纪元。

RECODEX PARTNERSHIP
你的项目,下一篇值得报道
RecodeX 为 AI×Web3 早期项目提供从深度报道到融资撮合的全链路服务。三档方案,按阶段匹配。