深度文章
信息来源:investinginai.substack.com 2026.08.17 04:47 约 12 分钟 AI 新发布

全球模型以及可能在这个新领域取得成功的公司

RECODEX · 深度文章 AI

5 家大型企业在基于新物理原理的世界模型领域具有优势

祝大家周日愉快,欢迎收听《AI 投资》节目!我的关于 AI 投资的书籍将于 9 月 15 日出版,目前已在 Amazon 上开启预购。别忘了关注《纽约市的 AI》播客。当然,如果您在推理成本方面支出过高,Neurometric 可以通过为您构建针对特定任务的小型模型,在不损失准确率的前提下帮助您将成本降低 80%。

今日资讯由专门提供人工智能训练与应用相关服务的咨询公司 Neuronify 赞助。快来获取免费的 AI 准备度评估吧。

世界模型概述

随着人工智能行业的进步,大型语言模型(LLMs)的范式已开始在现实世界物理实用性方面触及平台期。尽管 LLMs 擅长语法、文本推理、代码生成和语义分析,但它们缺乏对物理现实的基本锚定。人工智能的下一个数万亿美元前沿是开发和部署世界模型——这些 AI 系统内在地理解三维空间、时间、物理定律、物体恒存性以及因果关系。

对于投资者和机构资产配置者而言,从语言智能向空间与物理智能的转型,意味着大型科技企业在资本支出周期、数据垄断能力以及最终价值创造方面都将迎来重大变化。世界模型作为基础软件层,是实现通用自主移动系统、具身人形机器人、工业数字孪生以及超真实感空间计算所必需的。这些面向物理世界的应用所构成的总潜在市场规模,远远超过目前的基于文本的数字人工智能市场,这实际上也将人工智能的应用领域从数字知识工作领域拓展到了体力劳动、全球物流以及现实世界基础设施的自动化领域。

本次深度分析评估了业界顶尖研究实验室之间关键性的架构分歧:生成式模型(如 OpenAI 的 Sora 和 Google 的 Veo)与预测潜在模型(如 Meta 的 V-JEPA)。至关重要的是,它分析了五家在该领域占据主导地位的独特优势上市公司:NVIDIA($NVDA)、Alphabet($GOOGL)、特斯拉($TSLA)、Meta Platforms($META)和苹果($AAPL)。

第 1 部分:定义“世界模型”范式

为了准确理解世界模型的商业和技术轨迹,投资者必须首先将其与当前生成式 AI 聊天机器人的浪潮完全区分开来。LLM 处理文本令牌,基于海量人类语言语料库预测下一个统计上最可能的令牌。然而,语言是现实的一种高度压缩、低带宽且往往有缺陷的表示。LLM 可能在统计上知道“掉落的苹果会落到地面”,但它并不内在地理解重力、质量、碰撞动力学或空间几何;它仅仅复述了这些词语的句法关系。

世界模型是人工智能智能体对物理环境所建立的数学化内部表征。正如人类大脑会持续在后台运行直观的物理引擎,以预测抛出球体的轨迹或从陡峭路缘上迈步可能带来的后果,世界模型也能让人工智能模拟其所处的环境,并根据当前及潜在的动作来预测未来的状态。

向空间智能的转变

科技行业目前正从将通用人工智能(AGI)视为纯粹认知性、文本输入/文本输出的目标,转向追求物理 AI 或空间智能。世界模型的训练并非基于互联网文本,而是基于高保真视频流、激光雷达点云、汽车遥测数据以及 3D 空间交互。

当人工智能拥有一个强大且功能准确的世界模型时,它将获得以下能力:

  • 预测未来:精确预判物理场景随时间的变化(例如,预测人行横道附近的行人可能会步入街道)。

  • 在潜在空间中规划行动:在采取物理行动之前,先在“想象”中模拟多种行动方案,使机器人无需进行物理试错即可优化其路径规划和抓握力度。

  • 理解因果关系:认识到对物体施加力会导致其移动或破裂,而不仅仅是关联视频中的视觉像素。

没有世界模型,自动化机器只能依赖简单的碰撞转向启发式算法、硬编码规则或基础的视觉物体检测。而有了世界模型,具身人形机器人便能在动态杂乱的生产车间中自如导航,凭直觉操控易碎物品而不致损坏,并适应各种新奇的物理情境。

第 2 部分:技术分歧——生成模型与预测模型

实现精确世界模型的路径已分化为两种截然不同的方法论:生成式视频模型与联合嵌入预测架构(JEPAs)。

生成式世界模型(Sora、Veo、Runway)

生成式模型试图通过生成视觉像素来构建世界模型。这类系统通常是扩散模型或自回归变换器,它们在庞大的原始视频数据集上经过训练,以此预测并绘制出视频的后续帧。

  • 机制:该模型在试图生成逼真且时间上连贯的视频过程中,顺便学会了世界中的物理规律。

  • 局限性:
    • 极高的计算强度:要实现逐像素还原现实场景(30–60 帧/秒时每帧有数百万像素),就需要庞大的 GPU 集群,这使得其在边缘设备上实现实时处理变得效率低下。

    • 物理幻觉问题:生成模型更注重视觉上的合理性,而非严格的物理一致性,因此常常会出现物体变形、出现多余肢体,或穿透固体结构的情况。

    • 计算资源浪费:大量的计算能力被用于预测那些无关的背景细节(比如飘动的树叶),而非核心的语义动作,从而造成了资源浪费。

2. 预测型世界模型(Meta 的 V-JEPA)

关节嵌入预测架构(JEPA)会在非视觉的“潜在空间”中预测未来状态的抽象数学表征,而非直接生成原始像素。

  • 机制:视频序列在空间和时间维度上被遮蔽(隐藏),模型则负责预测缺失部分的数学嵌入值。这迫使神经网络学习语义层面的物理规律,而非表面的视觉纹理。

  • 优势:
    • 无与伦比的计算效率:由于完全在压缩后的潜空间中运行,V-JEPA 的训练与运行成本大幅降低,从而能够实现其在电池供电的边缘设备(人形机器人、AR 眼镜)上的实时部署。

    • 降噪处理:忽略不可预测的视觉噪声(如水面的波纹),仅关注整体的物理状态变化。

    • 物理实体建模:专为状态预测与因果推理优化,可避免生成过程中的形态错误。

核心要点:生成式像素模型(如 Sora/Veo)在媒体、娱乐以及合成数据创建领域表现优异;而由于延迟和能耗的限制,预测型潜空间模型(如 V-JEPA)才是实现实时物理智能系统、自动驾驶及机器人技术所必需的架构。

第 3 节:发展路径与市场时间表

  • 第一阶段:合成物理与视频生成(2025–2027 年)——即当前所处阶段。通过大规模算力部署来训练用于创意预可视化及合成数据生成的底层视频模型(例如,模拟极端驾驶场景以训练车辆智能系统)。

  • 第二阶段:具身人工智能与交互式智能体(2027–2029 年)——将潜在预测模型整合到物理硬件中。在结构化的工业环境(工厂、物流中心)中大规模部署通用操作系统智能体与人形机器人。

  • 第三阶段:无处不在的空间计算(2029 年及以后)——世界模型将部署在边缘网络中。消费级 AR 眼镜能够实现实时的语义环境映射,而家庭中的物理智能体则具备零样本泛化能力。

第 4 节:高价值商业应用场景

  • 自主移动:从脆弱的、手工编写的 C++规则转向由世界模型驱动的“端到端”神经网络。车辆基于物理和行为观察原生地预测安全轨迹。

  • 具身机器人:解锁通用人形机器人,使其能够适应不匹配的部件、折叠衣物或搬运箱子,而无需显式预编程。

  • 工业数字孪生:超逼真物理平台(如 NVIDIA Omniverse)在实体建造前模拟并优化完整工厂布局。

  • 空间计算与增强现实:实时房间几何映射,以精准锚定数字对象,避免裁剪或漂移。

  • 互动媒体与游戏:即时程序化生成庞大的开放世界环境,并对玩家的输入做出物理反应。

第 5 节:“五大巨头”的竞争分析

NVIDIA($NVDA):基础设施与模拟的支柱

  • 定位:作为世界模型时代不可或缺的收费站和模拟引擎。

  • 技术与数据栈:
    • NVIDIA Omniverse 与 OpenUSD:这是一种能够实现高精度 3D 物理模拟的平台,可用于构建工业数字孪生模型以及在虚拟环境中进行机器人训练。

    • GR00T 项目与 Isaac:类人机器人基础模型与机器人技术中间件。

    • Blackwell/Rubin 架构:专为高效处理密集型多模态视频模型而设计的专用高带宽计算架构。

  • 乐观情景:形成双边垄断。一方面销售用于训练世界模型的高利润 GPU,另一方面将 Omniverse 作为机器人技术领域不可或缺的合成数据引擎进行授权。

  • 悲观情景:缺乏专属的实体世界传感器集群。如果这些模型完全通过网络上的视频内容来学习物理规律,那么对合成模拟数据的依赖程度就会降低。向边缘端推理的转变则有利于使用设备自带的定制芯片。

2. Alphabet($GOOGL):无可匹敌的视频代码仓库与研究领域的领头者

  • 战略定位:凭借理论研究上的突破以及无可匹敌的视觉/空间数据库来确立主导地位。

  • 技术及数据架构:
    • YouTube 数据集:包含数百万小时的动作、物理现象及互动视频,构成了无与伦比的训练数据优势。

    • DeepMind Genie、Veo 与 SIMA:生成式世界模型(Genie/Veo)以及能够处理 3D 环境的通用智能体(SIMA)。

    • Waymo 车队:数千万英里的完全自动驾驶行驶里程,持续生成高精度的激光雷达/摄像头空间数据。

  • 看涨理由:全面的视觉数据优势,加上绕过 NVIDIA 硬件利润率的定制 TPU 芯片,带来结构性训练成本优势。

  • 看空理由:历史商业执行速度落后于研究速度。与 Apple 相比,在可穿戴边缘空间部署的消费级硬件布局上较为薄弱。

3. 特斯拉($TSLA):现实世界物理 AI 与边缘传感器车队

  • 定位:一家通过真实世界车队交互构建端到端视觉世界模型的应用型 AI/机器人实体。

  • 技术与数据栈:
    • 车队遥测:数百万辆配备 8 摄像头视觉套件的车辆持续上传边缘案例视频。

    • FSD 端到端神经网络:用基于视觉的神经网络取代了编码规则,这些神经网络充当连续实时的世界模型。

    • Optimus 人形机器人:将 FSD 视觉架构直接迁移至通用工厂自动化硬件。

    • Dojo 超级计算机:专为大规模非结构化视频训练而设计的定制芯片。

  • 乐观情景:难以逾越的交互式现实世界数据飞轮效应。人类干预会促使系统直接进行边缘端的物理参数校正。可通过 Optimus 直接实现向工厂自动化领域的拓展。

  • 悲观情景:战略上仅依赖视觉方案(不使用激光雷达/雷达)。如果在极端天气条件下,摄像头的分辨率或深度感知能力达到极限,自动驾驶系统的性能就会受到影响。

4. Meta 平台公司($META):预测型架构与 AR 传感器技术

  • 战略定位:通过主导开源模型实现软件的标准化生产,同时凭借可穿戴设备掌握第一人称空间捕捉技术。

  • 技术及数据架构:
    • V-JEPA(FAIR):一种处于行业领先水平的预测型潜在世界模型架构,注重计算效率。

    • Ray-Ban Meta 与 Orion AR:这类以自我为中心的智能硬件能够采集与视线高度相当的视觉及空间交互数据。

    • Llama Multimodal:将轻量级开源模型直接部署到边缘设备上。

  • 乐观预期:通过 V-JEPA 获得结构化数据优势与成本优势;能够独占对训练操作熟练度及物体操控能力至关重要的第一人称视角人类数据。

  • 悲观情景:缺乏工业或汽车领域的硬件配套。采用开源模型策略意味着无法获得直接的软件许可收入,因此所有盈利来源都依赖于硬件及广告业务。

5. Apple($AAPL):边缘空间传感器网络与定制芯片

  • 战略定位:避开云端训练领域的竞争,转而采用本地化、高度私密的边缘计算方式来实现空间智能处理。

  • 技术及数据架构:
    • 激光雷达与 TrueDepth 技术的影响:数亿部 Pro 版 iPhone/iPad 正在持续构建室内 3D 空间地图。

    • Apple Silicon 神经引擎:低功耗、低延迟的本地推理硬件。

    • Vision Pro 与 spatialOS:能够生成实时环境模型的高端空间计算硬件。

  • 乐观预期:通过在本地运行空间模型,解决了边缘推理的瓶颈问题。由于拥有高利润率的消费级硬件,无论模型由谁提供,都能通过应用商店的抽成实现盈利。

  • 看空理由:在服务器端 AI 集群基础设施和基础研究方面明显落后。与 Google 或 Tesla 相比,严格的隐私限制阻碍了集中式数据聚合。

第 6 节:资本配置策略

公司世界模型战略层级核心护城河关键催化剂(12-24 个月)

全球模型以及可能在这个新领域取得成功的公司

 

  • 短期(2025–2027 年):视频与空间模型训练对强大的计算能力需求较高,这使得 NVIDIA 成为最能从中受益的基础设施提供商。

  • 中期(2027–2029 年):价值将向真实世界传感器数据的所有者转移。特斯拉在物理自动化领域具备极高的增长潜力,而 Meta 则能提供以人为中心的主观视角数据,两者优势互补。

  • 长期消费端领域:Apple 凭借掌控着空间智能与终端消费者互动的高利润边缘硬件层,成为了该领域的有力防御性投资标的。

结论

人工智能的发展焦点正从文本生成(“模型能说些什么”)转向物理交互(“模型能做些什么”)。世界模型将成为未来十年技术投资的核心驱动力量。投资者不应只被文本型 LLM 的炒作所迷惑,而应把资金投向那些致力于构建仿真物理引擎、收集真实世界空间数据集,并在边缘端部署定制化推理芯片的企业。

感谢阅读。

了解 RecodeX 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读