物理AGI的卡点不在“更大模型”,而在视觉如何原生地理解四维世界

当英伟达与OpenAI相继宣称AGI时代已经到来,资本与创业者最焦虑的问题反而变得更加具体:一个能在真实物理世界中自主决策、自主行动、持续进化的智能系统,究竟应该长成什么样?答案显然不在继续堆高语言模型的参数量。语言模型可以在数字空间完成“输入—输出”的闭环,但物理AI面对的是材质、质量、力学属性、遮挡关系与时间连续性共同构成的四维现实。这里没有互联网几十年积累的海量标注数据可供Scaling,也没有一个天然封闭的训练环境让模型高效试错。

2026年8月,北京大学王选计算机研究所孵化出一家名为通视智能(VGI Labs)的新公司,试图用一套“4D原生视觉+系统架构+世界模拟器”的组合方案回答上述问题。据投资界报道,通视智能已完成数千万元人民币种子轮融资交割。公司核心团队六名成员全部来自北大王选所,由视觉数据理解与生成实验室主任王勇涛担任首席科学家,和创科技前联合创始人胡奎担任CEO。

与多数物理AI创业公司先讲“世界模型”或“具身智能”不同,通视智能把叙事起点放在了一个更底层的概念上:通用视觉智能(VGI)。据投资界报道,通视智能认为,开放物理世界中的智能系统必须依赖一套通用泛化的视觉能力,而当前LLM范式下的视觉编码器、多模态对齐与视频生成路径,并未真正解决“原生视觉”问题。这一判断构成了通视智能全部技术与商业叙事的起点,也让它与市面上大量“世界模型公司”形成了刻意区隔。

字段 内容
公司 通视智能(VGI Labs)
轮次 种子轮
金额 数千万元人民币
投资方 未披露
总部 未披露
创始人 王勇涛(首席科学家)、胡奎(CEO)
官网 未披露

“6+1”架构:VGI系统与WorldSim的模块关系

通视智能的技术方案由两部分构成:VGI系统与WorldSim世界模拟器。据投资界2026年9月报道,VGI系统由理解模型、世界模型、价值模型、执行器、配置器、知识库与记忆六大模块构成,加上WorldSim世界模拟器,形成“6+1”功能模块组合。据投资界报道,该架构继承了Yann LeCun的AMI系统框架,是类似人脑分区协作机制的高级智能架构。每个模块都是一个独立的基础模型,先单独构建和训练,再将六个模块桥接起来进行强化训练,从而形成一个完整的物理AI模型。

WorldSim是通视智能技术叙事中最具差异化的部分。据投资界报道,这是全球首个集“原生4D+物理+语义”于一体的高斯世界模拟器。这一“全球首个”为报道口径,尚无独立第三方验证。其技术路线瞄准4D高斯动态重建。在通视智能看来,现有的世界模拟器技术路线包括2D/2.5D视频生成、Mesh重建、3D高斯静态重建、4D高斯动态重建等,其中4D高斯动态重建是技术最先进、实现难度最大、效果和能力上限最高的路线。这一排序同样来自报道对通视智能技术判断的转述,并非行业共识。

从已披露的架构关系看,VGI系统与WorldSim被设计为相互增强:VGI的理解模型是构建4D高斯世界模拟器的重要基础;世界模拟器为VGI系统六大模块提供训练数据与训练环境;VGI系统整体能力提升后,又反过来增强理解模型,进而增强WorldSim。据投资界报道,VGI系统与WorldSim已形成相互增强的飞轮效应,整体研发ROI非常高。该表述尚无独立验证,来源未披露可量化的ROI数据或飞轮效应的验证指标。

从BEVFusion到4000万元研发合同:一支被产业界使用过的团队

通视智能的团队背景是理解本轮融资的关键。据投资界报道,由王勇涛领衔的科研团队累计发表论文100余篇,谷歌学术引用量过万;团队基于其背后的基础技术获得20多项国际AI顶级榜单第一名,主要集中在视觉理解、空间智能和物理AI领域。更具产业信号意义的是,团队提出的BEVFusion、DrivingGaussian等代表性工作获得英伟达、Waymo等公司的关注和使用。

与纯学术团队创业不同,通视智能在成立公司之前已经交付了十多项与知名企业和大厂的合作项目,累计金额超过4000万元,且全部是有技术成果交付的研发类项目。这一数据来自投资界报道,客户具体名称未披露。4000万元研发合同的存在,至少说明团队在产业化交付上并非从零开始,而是带着一套已经被产业界部分验证过的技术栈进入公司化运营。

但这里存在一个容易被忽略的边界:4000万元合作项目是团队在公司成立之前、以高校科研团队身份完成的,不等同于通视智能这家新公司的商业化收入。公司成立仅一个月左右,尚未披露任何以通视智能为主体签署的客户合同或收入。因此,这4000万元更适合被理解为团队技术能力的“历史证据”,而非通视智能的“当期业绩”。

团队规模方面,通视智能核心团队六名成员全部是北大王选所校友,除王勇涛和胡奎外,还包括两名零零后博士、大厂核心骨干以及北大王选所资深教授。若加上来自北大实验室的实习生,整个研发团队规模在30人左右。这一规模对于一家种子轮公司而言并不小,但也意味着人力成本与组织管理压力会比其他同期创业公司更早到来。

种子轮的钱从哪来:两个不同口径的资本结构

通视智能本轮融资的投资方名单未披露。这是本次融资事实中最关键的信息缺口。需要明确区分两个不同口径:一是种子轮融资金额,据投资界报道为“数千万元人民币”;二是启动资金认购金额,据投资界报道,公司原计划准备1000万元启动资金,两位创始人身边多位合作伙伴踊跃认购,金额很快超过3000万元。后者是启动资金认购口径,不必然等于本轮融资额,本文不作合并推断。

从已披露信息看,本轮融资呈现出一种“熟人资本先行”的特征。据投资界报道,胡奎透露自己在VGI Labs项目里经历了三个角色——最初是帮助者,为王勇涛提供团队和融资建议;继而像一位投资者,判断这套硬核技术在产业与资本上的真实价值;最终成为参与者,把经验、资源和承诺一起投入进来。这一表述说明,本轮融资的早期认购方大概率来自两位创始人多年积累的信任网络,而非典型的机构化种子轮流程。

本轮融资的投资方名单、投后估值、资金到账节奏均未披露,外部观察者难以判断本轮融资的定价逻辑和信号意义。对于一家成立仅一个月、技术路线高度前沿的公司而言,投资方是谁、以什么条件进入,往往比融资金额本身更能说明市场对这条技术路线的真实态度。在投资方名单缺失的情况下,数千万元种子轮融资的“信号价值”需要打一个折扣。

物理AGI的终局叙事与种子轮的现实约束

通视智能的叙事野心远超一家种子轮公司的常规表达。据投资界报道,通视智能的目标是实现物理AGI——一个能在开放物理世界中自主决策、自主行动、持续进化的智能系统。胡奎在投资界报道中直言:“我最担心的,是有人把VGI Labs当成又一个世界模型公司。”他还表示:“我们不追概念、不追热点,我们认为市场也永远不会有绝对共识,我们要做的就是深度思考物理AI的基本逻辑和规律,并不断打磨和验证我们的技术路线和方案。”

这种“反概念”的姿态,恰恰是通视智能最需要被审视的地方。物理AI领域当前确实充斥着各种概念与名词,但通视智能自身提出的“4D原生视觉”“VGI系统”“WorldSim世界模拟器”“6+1架构”同样是一套高度抽象的技术话语体系。区别在于,通视智能试图用BEVFusion、DrivingGaussian等已被英伟达、Waymo关注和使用的代表性工作,以及20多项国际AI顶级榜单第一名、4000万元研发合同等历史成绩,来证明这套话语体系并非空中楼阁。

然而,通视智能尚未披露任何以公司为主体交付的产品、客户或商业化里程碑。公司成立时间与融资披露时间高度接近,业务落地进展尚待验证。对于一家种子轮公司,这并非异常,但物理AGI的终局叙事容易让外界对公司当前所处阶段产生误判。具体而言,通视智能需要跨过的验证节点至少包括:六大模块桥接后的整体性能是否显著优于单一模型或多模态大模型路径;WorldSim生成的训练数据是否真的能提升VGI系统在真实物理场景中的泛化能力;以及这套系统能否在某个具体行业场景中交付可量化的商业价值。在这些节点被验证之前,物理AGI的终局叙事仍停留在技术愿景层面。

世界模拟器的竞争维度与通视智能的差异化赌注

通视智能并非唯一一家押注世界模拟器与物理AI的公司。由于公开资料未披露通视智能的具体可比公司,本文仅基于其已披露技术路线做竞争维度分析,而非具体公司对标。

通视智能的差异化赌注集中在两点:一是坚持4D原生视觉而非在现有LLM范式上做多模态扩展;二是将世界模拟器定位为VGI系统的训练基础设施,而非独立产品。这两点共同构成了公司“不是又一个世界模型公司”的自我定位。从技术路线看,4D高斯动态重建与2D/2.5D视频生成、Mesh重建、3D高斯静态重建的差异,直接体现在对时间连续性和物理属性的建模能力上。但这一差异化的可验证性,取决于通视智能能否披露以下指标:4D高斯动态重建在动态场景下的重建精度与计算成本;WorldSim生成的训练数据在VGI系统六大模块上的性能增益;以及VGI系统在真实物理场景中的泛化表现。这些指标目前均未披露。

从团队历史看,通视智能最熟悉的交付方式是“有技术成果交付的研发类项目”。这种模式现金流稳定,但规模化能力有限。如果通视智能希望以产业化方式加速研发落地,它需要在某个时点回答:公司的可复制收入从哪来?是继续承接大厂研发合同,还是将VGI系统或WorldSim产品化后对外销售?这一问题的答案,将决定通视智能是一家“技术交付公司”还是一家“产品公司”。

30人团队、一个月公司与组织约束

通视智能的团队构成在种子轮公司中属于高配。核心团队六人全部来自北大王选所,研发团队约30人,且据投资界报道,未来依托北京大学校企联合实验室等平台,还将吸引清北级别人才加入。这种人才密度是通视智能最核心的资产,也是其最需要管理的风险。

胡奎的角色在此处显得尤为关键。据投资界报道,胡奎从北大王选所博士毕业后投身创业,王勇涛从新加坡南洋理工大学回国,正是经胡奎介绍加入王选所任教。胡奎在和创科技期间积累了十五年的组织、融资与商业化经验。胡奎在通视智能的角色,正是把科学家团队最需要的组织、融资和商业化拼图补上。

但组织能力的验证需要更长时间窗口。30人团队中既有资深教授、大厂核心骨干,也有零零后博士和北大实习生,成员背景、激励机制与工作节奏差异显著。公司成立仅一个月,尚未经历完整的产品周期、客户交付周期或融资后续管理周期。胡奎自述“上一次创业整整十五年,我不是轻易承诺、也不是轻易放弃的性格”,这一表态来自创始人自述,其组织能力的验证需要更长时间窗口。

资金用途未披露,但技术验证路径已经清晰

通视智能未披露本轮数千万元人民币种子轮资金的具体用途。从公司当前阶段与技术路线推断,资金大概率将用于团队扩充、算力采购与WorldSim世界模拟器的持续构建。但这一推断仅基于行业常识,来源未提供任何资金用途信息。

更值得关注的是通视智能的技术验证路径。公司已经给出了相对清晰的验证链条:VGI系统六大模块先单独构建训练,再桥接强化训练;WorldSim基于4D高斯动态重建路线构建;两者通过理解模型形成飞轮。如果这条路径成立,那么通视智能接下来需要向外界证明的,不是“物理AGI终局”的宏大叙事,而是三个更具体的问题:第一,VGI系统六大模块桥接后的整体性能,是否显著优于单一模型或多模态大模型路径;第二,WorldSim生成的训练数据,是否真的能提升VGI系统在真实物理场景中的泛化能力;第三,这套系统能否在某个具体行业场景中交付可量化的商业价值。

通视智能的种子轮融资,本质上是在为一条尚未被完全验证的技术路线提供早期燃料。数千万元人民币的规模,对于构建4D高斯世界模拟器和训练六大基础模型而言并不宽裕。公司需要在资金耗尽之前,找到第一个可对外展示的、具备产业说服力的验证节点。这个节点可能是某个国际榜单的持续领先,可能是某个大厂合作项目的交付,也可能是WorldSim在某个具体场景中生成的训练数据被证明有效。无论哪个节点先到来,它都将比“物理AGI终局”的叙事更能决定通视智能的下一轮融资与生存空间。

验证边界与可复核指标

本文涉及的“首个、唯一、最大、领先”、订单、出货、性能等表述,如无另行说明,均是公司、创始人或投资方在现有公开材料中的披露口径;RecodeX未在本次采集材料中找到独立审计或第三方测试结论,因而不将其视为已经独立确认的事实。文中的产业协同、竞争位置和商业路径属于基于已披露产品与融资用途的编辑分析,不代表相关结果已经实现。

  • 技术侧应核验第三方测试条件、样本规模、良率、稳定性及与可比方案一致口径的结果;
  • 商业侧应核验去重后的付费客户、可执行合同、收入确认、复购率以及订单转化;
  • 资本与产业协同应以工商股权、关联交易、联合开发、采购或量产文件为准。

RecodeX 极客视:通视智能把物理AGI的赌注押在“4D原生视觉”而非更大的多模态模型上,这本身是对当前LLM范式的一次有意义的反叛。但种子轮公司最危险的时刻,往往不是技术被质疑,而是叙事跑在验证前面。当“全球首个高斯世界模拟器”“飞轮效应已经形成”“研发ROI非常高”这些表述尚未获得可量化证据支撑时,通视智能最需要的不是更多概念,而是一个能让产业界看见的、具体的验证节点。

信息来源

本文在采集与核验阶段引用了以下公开来源,按站点去重列出;来源内容归原发布方所有,其口径不代表 RecodeX 的核实结论。