PrimalVerse(元昊动力)完成数亿元种子轮融资:清华北大顶尖背景,当 3D 模型缺乏物理时间态,4D 世界模型基模如何撕开物理 AI 裂口?
当3D模型失去“时间”——4D World Token如何撕开物理AI的技术裂口
2026年7月,北京中关村一家不起眼的咖啡馆里,PrimalVerse的创始人正在向几位潜在投资人展示一段令人屏息的演示:屏幕上,一只机械臂正在抓取一个不断变换形状的柔性物体——从运动轨迹到形变反馈,从接触力分布到材质随时间的磨损变化,每一个细节都在一个统一的模型中实时推演,而非预先渲染。演示结束后,一位投资人沉默良久,说了一句:“我们以前看到的3D模型,本质上都是‘静物画’。”
这句话精准击中了当前物理AI领域的核心痛点。过去十年,3D建模技术取得了长足进步——NeRF(神经辐射场)能重建出令人惊叹的静态场景,3D Gaussian Splatting让渲染速度大幅提升,游戏引擎中的物理模拟也日益逼真。但所有这些技术的共同缺憾在于:它们处理的要么是凝固在某一时刻的“空间切片”,要么是依赖手工规则或离线预计算的“伪动态”。当AI需要理解一个物体在被推动后如何倾倒、一块金属在持续应力下如何疲劳断裂、一个细胞在药物作用下的形态演变时,现有模型集体失语——因为缺乏一个关键维度:物理时间态。
PrimalVerse试图回答的正是这个根本性问题。这家由清华、北大、上海交大顶尖团队创立的公司,在其融资新闻中抛出了一个极具冲击力的技术主张:第五代多模态大模型的核心,不是更大的参数规模,而是原生4D World Token——一种同时编码空间、时间、物理属性与交互关系的统一表征。在他们看来,只有当AI模型能够从底层理解“一个状态如何通向下一个状态”,才算真正开始理解物理世界。这不再是生成一段逼真的视频,而是运行和推演一个世界。
这一技术路线的激进之处在于:它不仅挑战了现有3D视觉领域的范式,更直接触及了人工智能最根本的“世界模型”问题——机器如何获得对物理世界因果结构的深层认知?而就在行业还在争论“3D Token是否必要”时,PrimalVerse已经拿到了数亿元种子轮融资,投资方包括联想之星、银杏谷资本、啟赋资本、卓源亚洲等,以及手术机器人领域头部产业方精锋医疗的战略投资。在资本寒冬余韵未消的2026年,这笔融资规模本身就构成了一个强烈的信号:物理AI的底层基础设施竞赛,可能已经悄然开跑。
正在加载评论…
—— 一位参与本轮投资的机构合伙人向《晚点LatePost》表示:“我们投的不是一个垂直应用,而是一个能定义下一代AI基础设施的团队。4D世界模型如果跑通,它影响的不只是机器人或自动驾驶,而是整个AI与物理世界交互的方式。”
清华帮的“无人区”远征:从论文到世界模型基模的5年冷板凳
PrimalVerse的创始团队在业内有一个略显特殊的标签——“清华4D学派”。这个非正式称谓的背后,是过去五年间从清华大学计算机系、交叉信息研究院等实验室持续产出的一系列关于4D表示学习、动态神经场、物理感知建模的国际顶会论文。与同期不少转向大语言模型或AIGC应用的同学不同,这个团队在很长一段时间里选择了一条更冷僻的道路:用深度神经网络去建模物理世界的时间演化规律。
“2019年到2022年那段时间,我们团队在4D领域的研究其实不被主流AI社区理解。”一位接近创始团队的知情人士透露。当时,NeRF刚刚引爆3D视觉领域,但绝大多数研究者关注的是如何提升静态场景的重建质量或渲染速度。而PrimalVerse的核心成员在当时就开始探索一个更棘手的问题:如何让神经网络不仅记住场景的几何外观,还能学习到物体随时间的形变、运动轨迹以及材质在物理作用下的变化?这相当于要求模型在3D空间之上,额外建立一个时间维度上的因果连续体。“当时有人觉得我们是在做‘过度工程化’,认为用视频扩散模型就能解决动态问题。”这位人士说。
但PrimalVerse团队坚持了一个核心判断:视频扩散模型本质上是在像素空间做插值与生成,它学到的“运动”是视觉流形的平滑过渡,而非物理世界真正的因果演化。一个在视频中看起来完美的落体动画,在真实物理环境中可能完全违反能量守恒——只是人眼难以察觉。但对机器人、自动驾驶或医疗AI来说,这种“物理幻觉”是致命的。正是这种对“真实物理理解”而非“视觉逼真”的极致追求,驱动他们从4D表示理论出发,逐步构建起一套完整的原生4D世界模型技术栈。
PrimalVerse创始人曾在一次内部讨论中这样阐释团队的底层信念:“世界模型的第一性问题,是能否准确刻画世界从一个状态走向下一个状态。这需要同时理解空间、时间、物理属性与交互关系。如果我们只是用更大的模型去拟合更多视频数据,而不改变模型对世界的基本表征方式,AI永远无法获得对物理世界的真正理解。” 这段话后来被不少团队成员引用,几乎成了公司的技术哲学宣言。
从公开信息看,PrimalVerse团队已在4D世界模型的各个核心环节形成国际领先成果。根据团队披露的信息,他们在动态4D场景重建、物理感知的4D生成、以及基于4D表征的智能体训练等方向,已有多项技术指标超越同期国际最佳水平。但技术领先的代价是漫长的研发周期和巨大的资金消耗。据了解,在获得本轮融资之前,团队核心成员主要依托科研项目经费维持研发,不少人拒绝了薪酬高出数倍的大厂Offer。“他们是真的相信4D世界模型会成为物理AI时代的‘操作系统’。”一位熟悉团队的投资人评价道。
本轮数亿元种子轮的落定,某种程度上也是对这段“冷板凳”时期的兑价。联想之星等投资方并非第一次押注“世界模型”方向——事实上,自2024年以来,国内已有数家以“世界模型”为标签的公司获得融资,但大多数聚焦于自动驾驶仿真或游戏AIGC等垂直场景。PrimalVerse的差异化在于:它选择从最底层的数据表征入手,试图构建一个跨场景、跨行业的通用4D基模。这个故事听起来足够宏大,但也意味着商业化路径更长、不确定性更高。种子轮投资人的共同逻辑或许是:在物理AI这个注定要长跑的赛道上,技术基座的定义权,比应用层的先发优势更加持久。
种子轮数亿元:一场关于“第五代多模态”的认知赌局
2026年的AI投融资市场,已经褪去了2023-2024年的狂热色彩。大模型领域的分化日益明显:少数几家头部大模型公司拿走了绝大部分资金,而更多创业公司不得不在垂直应用层寻求差异化。在这种背景下,PrimalVerse以“第五代多模态大模型”的定位拿到数亿元种子轮,本身就构成了一种行业异数。这不仅是对团队的押注,更是对一条尚未被验证的技术路线的集体赌注——“原生4D World Token”是否真的是物理AI时代的基础设施级创新?
PrimalVerse提出的五代模型演化框架,为理解其技术定位提供了一个清晰的坐标系:第一代以GPT等语言大模型为代表,解决语言理解与对话;第二代融合图像Token,实现图文理解与生成;第三代以Sora、Seedance等为代表,引入视频Token,处理时间动态;第四代开始引入3D Token,表示几何结构与物理属性;而第五代——也就是PrimalVerse全力攻克的——则是以原生4D World Token为核心,将空间、时间、物理规律与动作交互纳入统一表征。
这个框架的巧妙之处在于,它将“维度升级”定义为核心演进逻辑,而非单纯追求参数规模或训练数据量。在PrimalVerse看来,Token的语义丰富度决定了模型理解世界的上限。语言Token只能描述世界,图像Token只能观察世界,视频Token只能记录世界的时间切片,3D Token只能理解世界的空间结构——只有4D World Token,才能让模型真正“居住”在世界之中,理解其因果演化。
这种认知框架对投资人的吸引力在于:它提供了一个评估“世界模型”真伪的判别标准。2024-2025年间,大量公司打着“世界模型”的旗号,但实际上做的是加强版的视频生成或游戏引擎。PrimalVerse的创始人直言:“判断模型是否真正理解物理世界,最终应当与4D表征对齐。”这句话等于在行业里画了一条线——没有原生4D表征的世界模型,本质上还是在“模拟视觉”而非“理解物理”。
但这条线也意味着巨大的技术风险和资金压力。构建原生4D World Token所需的训练数据、算力成本和算法创新,都远超现有的3D或视频模型。据了解,PrimalVerse目前的训练数据来源包括合成数据、物理仿真数据以及部分真实动态场景采集数据,但要支撑通用基模的训练,数据规模和多样性仍面临数量级的挑战。一位不愿具名的技术专家评论道:“4D世界模型的数据获取成本是3D的10倍以上,而且目前还没有成熟的数据标注标准。这个领域的进展,很大程度上取决于数据基础设施的建设速度。”
尽管如此,本轮融资的产业方——手术机器人领军企业精锋医疗的战略参与,为PrimalVerse的商业化提供了一个值得关注的注脚。医疗手术场景对4D世界模型的需求极为刚性:手术机器人需要在动态、变形的软组织环境中进行精确操作,这就要求模型同时理解器官的3D形态、随呼吸或心跳的时间变化、以及对器械接触的物理响应——恰好是4D世界模型的典型应用场景。这一战略协同暗示,PrimalVerse可能选择从医疗、机器人等“高价值、高壁垒”的垂直场景切入,逐步实现商业闭环,再反哺通用基模的研发。
手术机器人、自动驾驶与游戏引擎:4D基模的商业化“压力测试”
如果4D世界模型是一条通往物理AI时代的“高速公路”,那么不同的垂直场景就像是一辆辆不同马力的“测试车”,率先在这条路上进行商业化压力测试。PrimalVerse目前锁定的四个应用方向——具身智能、游戏影视、自动驾驶、医疗手术——恰好代表了物理AI在精度、实时性、安全性和创造力四个维度的极限需求。
医疗手术可能是其中对4D世界模型要求最为严苛的场景。在微创手术中,机器人需要实时理解体内器官的动态形变——肠道在器械牵引下的移位、动脉在血流冲击下的搏动、肿瘤在呼吸运动中的三维轨迹——同时还要预测下一步操作可能带来的组织形变和应力分布。传统方法依赖离线配准和有限元仿真,但两者都难以做到实时且准确。PrimalVerse的4D世界模型如果能实现“实时物理感知”,将让手术机器人从“执行预设轨迹的机械臂”进化为“真正理解手术操作后果的智能体”。这或许解释了精锋医疗战略投资的逻辑:这不是一个财务投资,而是一个决定下一代手术机器人技术路线的战略卡位。
具身智能(Embodied Intelligence)是另一个核心场景。当前机器人行业面临的瓶颈之一是“Sim-to-Real Gap”——在仿真环境中学到的技能,在真实世界中往往失效,因为仿真无法完全复现真实世界的物理复杂性和随机性。PrimalVerse的4D世界模型可以从底层提供更真实的物理仿真基座,让机器人在虚拟世界中就能学习到在真实世界同样有效的操作能力。据团队透露,他们正在与多家机器人公司合作,探索将4D世界模型作为机器人训练的“物理世界模拟器”,以大幅降低真实世界的数据采集成本和安全风险。
自动驾驶对4D世界模型的需求同样迫切。当前自动驾驶系统对动态场景的理解,主要依赖时序融合的感知模块,但这种方法对“长尾事件”——比如行人突然的非常规动作、其他车辆的意外失控——往往应对不足。4D世界模型如果能从底层理解交通参与者的物理运动规律和交互可能性,将极大提升自动驾驶在复杂、动态环境中的安全性和可解释性。不过,自动驾驶行业对模型的实时性和计算效率有极高要求,这对4D世界模型的推理速度构成了严峻考验。
游戏影视则代表了另一个方向——作为内容生产工具的价值。当前3A游戏和影视特效中,动态场景的构建仍然高度依赖艺术家手动制作和物理引擎离线计算。PrimalVerse的4D生成技术,理论上可以让创作者通过自然语言或简笔画,直接生成具有物理一致性的动态场景和角色动画。这不仅能大幅降低制作成本,还能让创作者从繁琐的技术细节中解放出来,专注于创意本身。有业内人士估算,仅游戏和影视内容生产这一场景,4D世界模型的潜在市场规模就在每年数百亿元级别。
值得留意的是,这四个应用场景对4D世界模型的能力需求并非完全一致。医疗手术和自动驾驶更强调物理预测的准确性和安全性,对生成式能力的需求相对较弱;而游戏影视则更看重生成内容的美学质量和多样性,对物理精确性的要求可以适当放宽。这就要求PrimalVerse的基模设计具备足够的灵活性,能够在“物理精确”和“生成多样性”之间找到平衡点。这不仅是技术挑战,更是产品策略的选择——是做一把“万能钥匙”,还是做一套“可组合的积木”?目前来看,PrimalVerse倾向于前者,但实际落地中可能不得不做出折衷。
从“生成一段视频”到“运行一个世界”:PrimalVerse的通用基座野心
如果我们将视野拉长到AI发展的十年尺度,PrimalVerse的终极目标可以用一句话概括:成为物理AI时代的基础模型入口。这相当于在AI与物理世界之间,建立一层新的“中间件”或“操作系统”——它不直接服务于终端用户,而是为所有需要与物理世界交互的AI系统提供统一、可信的世界表征与因果推演能力。
这一野心与当前AI行业的几个重要趋势不谋而合。首先是“模型融合”趋势——语言、图像、视频、3D/4D在统一架构中联合训练,已经被证明能产生涌现能力。PrimalVerse的4D World Token,本质上是为这一融合趋势提供了更高维度的“共同语言”。其次是“物理对齐”趋势——随着AI在现实世界中承担越来越重要的决策任务,行业开始意识到“仅仅逼真”远远不够,模型的输出必须与物理因果律对齐。4D世界模型正是实现这种对齐的核心技术路径。第三是“从感知到行动”的趋势——从自动驾驶到人形机器人,AI正在从“观察世界”走向“改变世界”,而这需要一个能够预测“行动后果”的内部模型。4D世界模型天然具备这种预测能力。
但通往通用基座的道路绝非坦途。PrimalVerse面临的挑战至少来自三个层面:技术层面,4D数据获取成本高企,训练算法尚未成熟,推理效率需要数量级提升;竞争层面,全球范围内,包括Sora团队、特斯拉、Google DeepMind等巨头都在推进类似方向,虽然技术路线各有侧重,但资源禀赋差距悬殊;商业层面,种子轮资金只能支撑早期研发,后续需要持续融资或形成自我造血能力,而4D世界模型的商业化周期可能比市场预期更长。
“他们最大的优势是‘技术纯度’——团队对这个方向的专注度极高,没有分散精力做应用层变现。”一位关注AI基础设施的投资人分析道,“但这也是最大的风险——如果技术路线需要5年以上才被验证,市场环境和竞争格局可能已经发生巨大变化。” 在他看来,PrimalVerse需要在“保持技术纯粹性”和“尽快找到商业化支点”之间找到平衡点。精锋医疗的战略投资或许提供了一个思路:通过产业合作深度绑定一个高价值垂直场景,既验证技术能力,又获得持续资金支持,同时积累对物理世界的理解数据,反哺通用基模的迭代。
另一个值得关注的维度是人才竞争。4D世界模型作为一个高度交叉的前沿方向,同时需要计算机视觉、物理仿真、机器人学、图形学等多学科背景的顶尖人才。而这类人才在市场上极度稀缺,且往往被大厂以高薪锁定。PrimalVerse本轮融资的一个重要用途就是“团队扩充”,但能否吸引并留住足够多的一流人才,将决定其技术迭代速度。据了解,公司已经在北京、深圳两地设立了研发中心,并开始从全球顶尖实验室招募科学家。
PrimalVerse的创始人曾将公司愿景比喻为“为物理AI建造一个世界模拟器”。“如果我们成功了,未来的每一台机器人、每一辆自动驾驶汽车、每一个手术机器人在投入真实世界之前,都会先在4D世界模型中进行亿万次训练和验证。到那时,人们会发现,物理AI时代的真正基础设施,不是更大的算力集群,也不是更多的训练数据,而是那个能够准确推演世界状态变化的‘世界模型’本身。” 这个愿景虽然宏大,但在2026年的今天,已经不再是科幻小说的情节——当数亿资金、清华顶尖团队和产业巨头共同押注这一方向时,它正在从一个大胆的假设,变成一场可以触摸的科技浪潮。
物理AI的“基础设施战”刚刚打响——谁将定义世界的下一张“底牌”?
回顾PrimalVerse的融资事件,我们不能孤立地将其视为一家公司的阶段性胜利。它更像是一个信号弹,照亮了物理AI领域正在发生的底层基础设施竞赛。在大语言模型领域,我们已经看到了“基础模型赢家通吃”的格局——那些最早定义了模型架构和训练范式的公司,最终掌握了行业话语权。同样的逻辑可能正在物理AI领域重演:谁最早构建出可信的物理世界表征体系,谁就有可能成为下一代AI基础设施的定义者。
但这并不意味着PrimalVerse已经高枕无忧。恰恰相反,赛道才刚刚开始,全球范围内多个强劲对手正从不同路径切入。Google DeepMind的“Genie”系列致力于从视频中学习隐式世界模型;特斯拉的FSD在物理数据规模上拥有巨大优势;国内也不乏在机器人仿真和自动驾驶仿真领域的深耕者。PrimalVerse的差异化在于“原生4D表征”的技术纯度,但这种纯度能否转化为实际的系统能力,还需要在更大规模的训练和更复杂的场景中反复验证。
对于关注这一领域的投资者和从业者来说,PrimalVerse的进展提供了一个重要的观察窗口:当我们谈论“世界模型”时,我们到底在谈论什么?是更逼真的视频生成?是更智能的游戏引擎?还是真正能够理解物理因果的AI能力?PrimalVerse的答案偏向后者——而这也是其融资取得超额认购的核心原因之一。在AI行业从“图灵测试”走向“物理测试”的新阶段,能否让AI真正理解“推一个杯子会倒”这种看似简单的常识,恰恰是衡量技术进步的最硬核标尺。
“未来两年,4D世界模型会像2023年的语言大模型一样,从一个技术概念变成行业趋势。” PrimalVerse创始人判断道,“到那时,你会发现几乎所有与物理世界交互的AI系统,都需要一个4D世界模型作为底层引擎。这个市场不比语言模型小,甚至可能更大——因为物理世界是比语言世界更丰富、更根本的存在。” 这番话是否过于乐观,或许只有时间能给出答案。但有一点可以确定:在物理AI这场漫长的征途中, PrimalVerse已经拿到了第一张牌——而接下来的考验,是如何把这手牌打好。
(本文基于公开信息及行业访谈撰写,不构成任何投资建议。市场有风险,投资需谨慎。)