原创报道
2026.07.29 04:27 约 12 分钟 AI人工智能 新发布

通视智能完成数千万元种子轮融资:多模型协作路径挑战视觉AGI主流范式

项目速览
项目名称 通视智能
融资轮次 种子轮
融资金额 数千万元
通视智能完成数千万元种子轮融资:多模型协作路径挑战视觉AGI主流范式 封面

当一台人形机器人试图从冰箱里取出鸡蛋,它需要判断门的开关状态、握力的大小,更要理解“轻拿轻放”背后的物理常识——鸡蛋在受力过度时会碎裂。这种对人类而言近乎本能的视觉理解,对今天的 AI 仍是巨大挑战。视觉大模型可以生成一段以假乱真的视频,却可能在一帧真实工厂监控画面里,把叉车阴影误判为一个即将坠落的货箱。视觉智能如何从“看起来像”跨越到“物理上对”,正成为具身智能和高阶自动驾驶必须翻越的技术隘口。

正是在这个十字路口,一桩人事变动与一笔早期融资将一家低调的公司推至台前。2026 年 7 月,新三板企业和创科技发布公告,联合创始人、副总经理兼财务负责人胡奎辞去日常管理职务,旋即加盟北京大学王选计算机研究所孵化的视觉 AGI 创业项目——通视智能。与此同时,通视智能宣布已完成数千万元种子轮融资,加速场景理解等基础模型的定型与迭代,目标直指一个尚未被清晰定义的赛道:通用视觉智能(Visual General Intelligence,简称 VGI)。

这不是一个简单的科学家创业故事。胡奎作为和创科技的 CFO,曾主导引入雷军、红杉中国、联想创投等明星资本,推动一家传统 SaaS 公司实现北交所 IPO 过会,又在 2025 至 2026 年亲手将公司带向“All in AI”战略——AI 业务合同回款突破千万元。如今他重返母校实验室,担纲商业化职责。

公司 通视智能
轮次 种子轮
金额 数千万元
投资方 未披露
总部 未披露
创始人 未披露
官网 未披露

“科技顶天、市场立地”:一个 CFO 为何重返燕园

通视智能的诞生地——北京大学王选计算机研究所,本身是一个技术信仰与产业执念交织的符号。胡奎的导师汤帜所长延续王选先生“科技顶天、市场立地”的信条,而胡奎的职业轨迹几乎是这句话的复刻:从燕园求学,到参与创办和创科技并亲手构建其资本版图,再到如今回到技术源头。他曾兼职东方富海企业服务基金合伙人,投过前沿技术公司;也当过金科信息 CEO,在银行业信息化、云计算领域做过业务拓展。这些履历放在视觉 AGI 面前,显得既遥远又贴合——遥远是因为从 SaaS 到视觉基础模型存在巨大行业鸿沟,贴合则在于胡奎反复扮演的角色,都是将前沿技术翻译成商业合同的那个人。

在和创科技,胡奎主导 AI 战略转型的经历更值得审视。2025 年,公司 AI 业务合同回款突破千万元,第二年正式确立“All in AI”战略并推出原生 AI 产品。这个速度说明传统企业服务公司已经在用真金白银投票,愿意为能够解决具体场景问题的 AI 付费。但企业级 AI 产品与底层视觉基础模型之间存在本质区别:前者通常聚焦于固定流程的智能优化,例如 AI 招投标系统只需要理解文本与报价逻辑;后者则要面对开放物理世界的无限长尾问题。胡奎从产业端带来的经验能否迁移到更底层、更硬核的通用视觉技术上,目前没有公开案例可循。

不是“暴力缩放”,通视智能要搭建多模型协作的视觉智能体系

通视智能的技术叙事试图绕开一个拥挤的战场。当前主流的视觉基础模型路径,大多延续了语言大模型的范式:更大规模的视觉数据、更多的参数、更强的生成能力,所谓“暴力缩放”。OpenAI 的 Sora、Google 的 Veo 等模型沿着这条道路不断推高视频生成的逼真度。但通视智能提出的 VGI 架构,没有选择直接参与这场军备竞赛,而是把筹码押注在另一种可能性上——多模型协作、因果推理与物理一致性。

根据官方介绍,VGI 架构由三个模块构成:通用视觉基础模型、集重建—理解—生成—仿真于一体的世界模拟器系统、以及多基础模型协作的 VGI 系统。这三大模块的分工与协作是理解通视智能技术路线的关键。通用视觉基础模型承担对物理世界的视觉信号进行通用表征的任务,它的能力直接决定了后续模块可提取信息的质量与维度。世界模拟器系统则要求在三维空间中对场景进行重建、理解、并进一步生成和仿真,目标是建立对物理规律内在一致的模拟——它不仅要知道物体在图像中的位置,还要理解物体之间的几何关系、材料属性和运动规律。而多基础模型协作层试图将不同专长的视觉模型编排在一起,让它们像专家团队一样协同工作,而不是依赖一个单一巨模型输出所有答案。这种架构在理论上可以提升系统对复杂、动态场景的适应能力,同时让不同模型各司其职,降低对单一超大规模模型的算力依赖。

这一思路的学术基础来自王勇涛团队。通视智能核心技术由北京大学王选所副研究员、视觉数据理解与生成实验室主任王勇涛领衔。团队提出的 BEVFusion、DrivingGaussian 等算法框架已被英伟达、Waymo 等公司采纳,并在自动驾驶、3D 视觉等领域十余项国际权威评测中长期霸榜。BEVFusion 通过融合多视角相机与激光雷达信号,使车辆在复杂交通场景中获得更稳定、更鲁棒的环境表征;DrivingGaussian 则在三维高斯溅射的基础上,实现了对大规模驾驶场景的高效重建与仿真,为自动驾驶虚拟测试提供了高保真度的动态环境。团队还承担了十余项国家级及企业横向课题,经费总额超过 4000 万元,多个成果已在互联网大厂和车企中落地应用。仅从学术指标看,这支团队具备世界级竞争力。然而,学术框架被巨头采纳,与推出一套可稳定商业化的产品系统,中间所差的不止是工程化的工作量,更是一个产品定义和需求校准的复杂过程。

学术顶刊与产业鸿沟:被 Waymo 采纳之后,还有几步走

BEVFusion 在多传感器融合感知任务上表现突出,DrivingGaussian 则在自动驾驶场景重建与仿真中展现出高效性。Waymo 将它们纳入自身系统,说明这些方法在真实路测数据的某些环节中有用。但这不等于通视智能可以直接把实验室代码变成车企可以直接部署的模块。

在自动驾驶产业链里,视觉感知模块只是整条流水线的一环,上游连接着传感器硬件与标定,下游对接规划控制与安全验证。车企和 Tier 1 供应商对软件的要求绝不是一款竞赛榜上的模型,而是兼备低延迟、高鲁棒性、可解释性、功能安全认证等条件的量产级组件。通视智能的团队目前披露的信息集中在算法层面,对于工程化部署所必需的工具链、中间件、与主流芯片的适配情况,以及是否具备通过 ISO 26262 等功能安全标准认证的路径,均未公开。这意味着其从算法到产品级交付尚存大量工程空白,而这些空白往往是技术创业公司最容易低估的成本所在。

类似挑战同样存在于具身智能领域。人形机器人需要在动态环境中实时理解物体属性、空间关系与事件逻辑,视觉模型不仅要“看”,还要能输出可供下游操作任务使用的结构化语义信息。但当前行业内普遍使用的视觉系统,仍高度依赖结构化的环境设定和预定义的任务序列,一旦进入开放式家居或工业场景,错误率会急剧上升。通视智能强调因果推理和物理一致性,恰恰击中了这一痛点。但学术论文中的因果推理往往建立在对数据的离线分析上,能否在机器人每秒 30 帧的感知节奏中实时完成,决定了这一技术故事是否只停留在纸上。目前团队尚未披露任何关于推理延迟、算力消耗或边缘部署的指标,外界无从判断其模型在真实嵌入式场景中的可行性。

具身智能的视觉基座:从实验室到产线,验证链条有多长

如果把视角拔高到产业链层面,通视智能面对的是一个等待基础设施的早期市场。具身智能的爆发需要三个支柱:运动控制、任务规划、以及通用视觉理解。前两者分别有强化学习和大语言模型的支撑,而视觉理解至今仍是短板。没有对物理世界的实时、准确、因果一致的表征,再灵活的运动控制也只能在场景中盲目游走。因此,视觉基座被广泛视为具身智能从实验室走向实际部署的关键瓶颈。

通视智能将自身定位为 VGI 系统的完整实现者,这意味着它要提供的不是单一算法,而是一个包含基础模型、模拟器、多模型调度在内的整体解决方案。这种定位在理论上可以构建更高的壁垒,但也会面对更长的验证周期。一个典型的具身智能客户,需要先在仿真环境中对视觉系统做大量测试,再迁移到真实硬件上进行泛化评估,最后还要根据特定垂直场景进行微调。整个过程动辄十二个月以上,且每一步都可能暴露新的长尾问题。对一家刚刚完成种子轮的公司而言,时间窗口和资金储备是否足够支撑到标杆客户的规模化复购,还没有答案。而如果具身智能行业本身在未来两年仍停留在小批量试制和概念验证阶段,视觉基座供应商的商业化节奏也将被迫延长。

更现实的问题是,当前市场上愿意为通用视觉智能付费的客户在哪里。具身智能机器人尚处于试产和概念验证阶段;高阶智驾领域虽然需求明确,但已有大量视觉感知方案供应商和主机厂自研团队盘踞。通视智能要从这两端切入,就必须证明其多模型协作体系带来的增益,显著高于客户自行整合现有视觉模型或使用其他第三方方案的成本。

资金空窗与密集资本:种子轮数千万元背后,投资逻辑未明

本次种子轮融资披露的投资金额为“数千万元”,投资方未披露。这种信息布局在早期硬科技项目中并不少见,但结合胡奎的加入,仍然释放出一些可资观察的信号。胡奎在和创科技期间积累的资本网络覆盖面极广,从早期风险投资到券商直投、产业资本均有深度合作。

更值得追问的是,这笔融资对应的估值、出让股份、以及投资人在尽职调查过程中所押注的核心假设。早期硬科技投资往往看重团队背景和技术趋势,但若落地节奏不及预期,则容易被流动性压力反噬。

另一个不确定因素是资金用途。公司仅表示将用于加速场景理解等基础模型的定型与迭代,并打造垂直场景解决方案。这种表述相当于没有任何具体分解:场景理解需要什么样的数据采集和处理成本?垂直场景是自动驾驶的某个细分环境,还是具身智能中的特定操作域?没有明确的资源分配预期,外界很难衡量种子轮资金的使用效率。

“多模型协作”与单一大模型的替代竞争:路径差异还是阶段性口号

通视智能最核心的技术主张——多模型协作与物理一致性,与当前主流的单一视觉大模型路线形成了鲜明分野。但这也带来一个新的问题:这一分野是本质性的技术超前,还是受限于资源规模而被迫选择的差异化叙事?

训练一个真正的单一视觉大模型,需要海量多模态数据、万卡级算力集群和数十亿美元级别的资本投入。通视智能的种子轮规模意味着它在现阶段不可能走通这条路。公司转而强调多个中小模型之间的协作与因果推理,这确实与近年学界对模型组合优化、结构化推理的研究趋势吻合。但缺少大规模算力验证的情况下,“多模型协作”带来的整体性能未必能超越同等算力投入下的单个大模型,甚至可能因为模型间调度和一致性维护引入额外的计算开销。如果单一模型随着算力堆叠持续展现涌现能力,那么通视智能的路线可能需要付出更高的系统复杂度才能获得与之持平的性能,这将在商业化中构成成本劣势。

进一步说,物理一致性的保证在技术上有多个层次。是最底层的刚体动力学模拟,还是对流体、柔性物体的真实还原?是二维界面上的视觉合规,还是三维空间中的因果推断?不同的定义对应着完全不同的仿真计算代价。通视智能的世界模拟器系统具体建立在哪种物理求解精度上,目前没有任何公开信息,这使得“物理一致性”这个词听起来更像一个愿景而非可以交付的功能。只有当公司明确其模拟器能够处理的物理对象类别、支持的交互粒度和仿真频率后,外部才能真正评估其技术壁垒的高度。

胡奎的考题:能否把 SaaS 的 AI 落地经验复制到视觉 AGI

整个事件中最令人好奇的一环,是胡奎的个人角色。他不是科学家,也不是传统意义上的 AI 产品经理,而是一个财务和资本背景、经历过一家公司从零到 IPO 再到 AI 转型的总经理级人物。

不过,SaaS 公司卖 AI 产品的逻辑与视觉基础模型公司寻找商业出口的逻辑相去甚远。SaaS 的 AI 产品通常可以快速封装成标准模块,通过 API 或者界面交付,客户价值可以在合同金额上直接体现。和创科技 2025 年 AI 业务回款突破千万元,意味着已有数百家客户愿意为具体的 AI 功能付费。但视觉基础模型很难直接销售;它要么以 SDK 或平台形式为开发者提供服务,要么深度嵌入汽车、机器人、智能终端等硬件产品中,两种路径都要求漫长的集成和适配。胡奎过去撬动企业级客户的经验,在面对汽车巨头或机器人整机厂时,能否在谈判桌上产生同等效力,还需要实战检验。

反过来看,胡奎作为澳门优秀人才引进计划首期入选者、高新技术产业委员会主任,在跨境资源整合上的背景,可能为通视智能打开大湾区具身智能或智能驾驶产业合作的机会窗。但在公开层面,这些资源尚未转化为可追溯的商业进展。

通视智能的叙事结构已足够清晰:顶级学术团队 + 产业老兵 + 差异化技术路线。种子轮融资让这套叙事获得了第一笔外部资金和一定时间窗口。接下来,它必须在一个高度不确定的市场中,把论文里的指标变成客户系统中的稳定输出,把“物理一致性”从一个学术概念打磨为可量化的工程指标,并证明多模型协作不是一次对资源短缺的妥协,而是一条真正比暴力缩放更优的路径。当资金不再神秘,当产品真正进入客户的测试场景,那个时刻才是通视智能真正面对行业发问的开始。

RecodeX 极客视点:视觉 AGI 的战场上,通视智能选择了一条与主流大相径庭的道路,用多模型协作挑战暴力缩放。这个方向在学术上源远流长,但商业化历史上尚未跑出真正意义上的成功案例。胡奎的加入补齐了团队在资本和产业落地上的短板,却也带来了一个更尖锐的问题:当学术荣誉足够耀眼,你是否还是那个老实回答“我们还没解决”的团队?种子轮的数千万元买的不是答案,而是一个在技术理想与现实约束之间不断试错的权利。

RECODEX PARTNERSHIP
你的项目,下一篇值得报道
RecodeX 为 AI×Web3 早期项目提供从深度报道到融资撮合的全链路服务。三档方案,按阶段匹配。