原创报道
2026.07.16 21:31 约 12 分钟 AI人工智能 1.1万 阅读

爱诗科技:29.8亿融资背后的“世界模型”豪赌,AI视频的终极形态是什么?

项目速览
项目名称 爱诗科技
融资轮次 C轮(C+轮领投)
融资金额 29.8亿元人民币
投资方 阿里巴巴(领投)、Lollapalooza Capital(王慧文家办)、常春藤资本、惠远资本、钟鼎资本、韩国未来资产、OCBC生态下Lion X基金、蓝色光标、CloudAlpha、iGlobe Partners等

2026年7月14日,爱诗科技宣布完成整体C轮融资,本轮累计融资金额高达29.8亿元人民币。其中,C+轮由阿里巴巴领投,Lollapalooza Capital(王慧文家办)、常春藤资本、惠远资本、钟鼎资本、韩国未来资产、OCBC生态下Lion X基金、蓝色光标、CloudAlpha、iGlobe Partners等十余家国内外机构参与投资。这笔融资不仅是2026年AI视频赛道最大的一笔单轮融资,更标志着行业从“文本生成视频”的初级阶段,正式迈入“实时世界模型”的深水区。长期以来,AI视频生成面临两大核心痛点:一是生成内容缺乏物理世界的因果逻辑,导致“反重力”、“穿模”等荒谬现象频发;二是生成效率低下,无法满足实时交互和工业化生产的刚性需求。爱诗科技试图用29.8亿的资金,同时攻克这两座大山——它不仅要让AI“看见”视频,更要让AI“理解”世界。

公司名称 爱诗科技
融资轮次 C轮(C+轮领投)
融资金额 29.8亿元人民币
投资方 阿里巴巴(领投)、Lollapalooza Capital(王慧文家办)、常春藤资本、惠远资本、钟鼎资本、韩国未来资产、OCBC生态下Lion X基金、蓝色光标、CloudAlpha、iGlobe Partners等
官网 https://www.aishi.com

行业痛点与底层逻辑:当AI视频的“幻觉”撞上物理世界的“铁律”

在爱诗科技成立之前的2023年,AI视频生成赛道已经经历了第一轮“野蛮生长”。以Runway、Pika为代表的早期玩家,通过扩散模型(Diffusion Model)实现了从文本到视频的“魔法”。然而,这种魔法是脆弱的——它生成的视频往往只有几秒钟,且充满了违背物理常识的“幻觉”:一杯水被倒出后,水流在空中凝固;一个人走路时,双腿像面条一样扭曲;物体在场景中凭空消失或出现。这些问题的根源在于,当时的模型本质上是一个“像素预测器”,它只学习视频帧之间的视觉相似性,而从未学习过物体为什么会下落、水为什么会流动、光为什么会反射。

行业的底层逻辑正在发生根本性转变。用户不再满足于“能看”的视频,而是要求“能用”的视频——广告公司需要产品展示视频中物体运动轨迹符合物理定律;游戏公司需要实时生成的交互场景中角色动作不穿模;电影制片厂需要长镜头中光影变化保持一致性。传统解决方案(如手工制作3D动画、实景拍摄)成本极高,且无法规模化。而第一代AI视频工具,虽然降低了生成门槛,却因为“物理无知”导致成品率极低,专业用户往往需要花费数小时去修复AI生成的“低级错误”。

更深层的矛盾在于,视频生成模型的训练范式存在结构性缺陷。目前主流方法依赖大规模互联网视频数据(如YouTube、TikTok),这些数据天然包含大量人类拍摄的“真实”画面,但模型在训练时只关注像素层面的分布,忽略了隐藏在像素背后的物理规律。例如,一个模型可能学会了“猫从桌子上跳下来”的视觉模式,但它并不理解“重力加速度”和“动量守恒”。当用户要求生成“猫从桌子上跳下来,然后优雅地落地”时,模型可能生成猫在空中悬浮两秒再垂直下落,因为它在训练数据中见过太多“慢动作”或“剪辑”片段。

爱诗科技看到了这个结构性机会。其创始人团队在2024年初的内部信中写道:“视频生成的下一个十年,不是更长的视频,而是更‘真实’的视频。真实意味着视频中的每一帧都必须符合物理世界的因果律。”这种判断促使公司放弃了“堆算力、堆数据”的粗放路线,转而投入“世界模型”的研发——即让AI不仅学会生成像素,更学会模拟物理世界的运行规则。这需要从根本上改变模型架构:从“扩散模型+时序注意力”的简单组合,转向“神经辐射场+物理模拟器+强化学习”的复合架构。

市场数据也印证了这一趋势。2025年,全球AI视频生成市场规模达到120亿美元,但其中超过60%的需求来自专业影视制作、广告营销和游戏开发领域。这些客户对视频的“物理合理性”要求极高,他们愿意为“一个符合牛顿定律的10秒视频”支付比“一个充满幻觉的30秒视频”高出10倍的价格。爱诗科技瞄准的正是这个高价值、高门槛的细分市场。

技术创新与核心架构:从“像素生成”到“世界模拟”的架构革命

爱诗科技的技术路线可以概括为“三层架构”:底层是“多模态视频大模型”,负责理解文本、图像、音频等多模态输入;中层是“实时世界模型”,负责构建物理世界的因果逻辑;顶层是“原生AI视频产品”,负责将底层能力转化为用户可感知的体验。其中,最核心的突破在于“实时世界模型”的工程实现。

传统视频生成模型(如Stable Video Diffusion)采用“UNet+时序注意力”架构。UNet负责在潜在空间中对图像进行去噪,时序注意力负责建立帧与帧之间的关联。这种架构的缺陷在于,它本质上是一个“2D+时间”的模型,无法理解3D空间中的物体关系。例如,当生成“一辆汽车从远处驶来”的视频时,模型可能让汽车在画面中突然变大,而不是按照透视原理渐进放大,因为它没有学习“近大远小”的几何规则。

爱诗科技的世界模型采用了“神经辐射场(NeRF)+物理引擎”的混合架构。具体来说,模型首先通过NeRF将输入文本或图像转化为一个隐式的3D场景表示,包含物体的几何形状、材质属性和光照条件。然后,一个轻量级的物理引擎(基于可微分物理模拟器)对这个3D场景进行“因果推理”:它计算物体之间的碰撞、重力作用、流体动力学等物理效应。最后,模型通过一个“神经渲染器”将推理后的3D场景渲染为2D视频帧。整个过程是端到端可微的,这意味着物理引擎的参数也可以从数据中学习。

这种架构带来了三个显著优势。第一,物理一致性。因为视频的每一帧都是从同一个3D场景渲染而来,所以物体不会凭空消失或变形。第二,长视频能力。传统模型生成超过10秒的视频时,误差会指数级累积,导致画面崩坏。而爱诗科技的世界模型因为维护了一个稳定的3D场景,理论上可以生成任意长度的视频,只要物理引擎的模拟步长足够小。第三,交互性。用户可以在生成过程中“干预”物理世界——例如,改变光源位置、移动物体、调整重力加速度——模型会实时重新计算物理效果并更新视频。

在工程实现层面,爱诗科技面临的最大挑战是计算效率。NeRF的渲染速度通常很慢,一张1080p的图像可能需要数秒。为了达到“实时”生成(每秒24帧以上),团队采用了“稀疏体素网格+多分辨率哈希编码”的优化方案。他们将3D场景表示为稀疏的体素网格,只存储有物体的区域,从而将内存占用降低90%。同时,使用多分辨率哈希编码加速NeRF的查询速度,使得单帧渲染时间从秒级降至毫秒级。

此外,爱诗科技还自研了一套“因果注意力机制”(Causal Attention)。传统的Transformer注意力机制会平等地关注所有帧,导致模型无法区分“原因”和“结果”。因果注意力机制强制模型只关注时间上更早的帧,从而学习到“先有因,后有果”的逻辑。例如,在生成“一个人推倒多米诺骨牌”的视频时,模型会先关注“推”的动作,然后才关注“骨牌倒下”的结果,而不是反过来。

训练数据方面,爱诗科技构建了一个独特的“物理标注数据集”。团队从YouTube上爬取了超过500万小时的视频,并使用自动标注工具(基于预训练的动作识别模型和物理模拟器)为每个视频片段标注了物理属性:物体质量、摩擦系数、弹性系数、重力方向等。这些标注数据被用于训练世界模型的物理引擎部分,使其能够从真实视频中“蒸馏”出物理规律。

产品层面,爱诗科技旗下拥有面向全球用户的PixVerse、面向中国市场的拍我AI,以及面向团队生产、开发者集成和未来交互的系列模型、产品与能力。PixVerse主打“一句话生成物理正确的视频”,用户输入“一个苹果从树上掉下来,砸到牛顿头上”,模型会生成一个符合自由落体运动、碰撞检测和表情变化的视频。拍我AI则更侧重于中国市场,支持中文输入和本地化场景(如“一个人在北京胡同里骑自行车”)。开发者平台提供了API接口,允许第三方应用集成爱诗科技的视频生成能力。

商业模式与市场竞争:29.8亿的“护城河”能挖多深?

爱诗科技的商业模式可以概括为“三层变现”:面向C端用户的订阅制(PixVerse和拍我AI)、面向B端企业的API调用制、以及面向大型客户的定制化解决方案。C端订阅价格从每月9.9美元(基础版,支持720p视频生成)到99.9美元(专业版,支持4K视频生成和物理引擎自定义)不等。B端API按调用次数收费,每次生成成本约为0.1-0.5美元,取决于视频长度和分辨率。定制化解决方案则针对影视公司、游戏工作室和广告代理商,价格从数十万到数百万美元不等。

这种分层定价策略的核心逻辑是“物理正确性”的溢价。在C端市场,用户可能对“物理幻觉”容忍度较高,因此基础版使用传统扩散模型,成本较低。但在B端市场,客户对物理正确性有刚性需求,因此专业版使用世界模型,成本更高但价值也更高。例如,一家汽车广告公司需要生成“一辆汽车在雪地中漂移”的视频,如果AI生成的雪花飘落方向与汽车运动方向不一致,广告效果就会大打折扣。爱诗科技的世界模型可以确保雪花飘落符合空气动力学,从而为客户节省后期特效成本。

市场竞争方面,爱诗科技面临来自三个方向的挑战。第一是国际巨头,如OpenAI(Sora)、Google(VideoPoet)和Meta(Make-A-Video)。这些公司拥有更强大的算力资源和更庞大的数据规模,但他们的产品更偏向通用型,尚未针对“物理正确性”进行专项优化。第二是垂直领域的竞争对手,如中国的生数科技(Vidu)、美国的Runway(Gen-3)和Pika(Pika 2.0)。这些公司也在尝试引入物理模拟,但大多采用“后处理”方式——先用传统模型生成视频,再用物理引擎修正——导致生成效率低下。第三是开源社区,如Stable Video Diffusion的衍生模型。开源模型虽然免费,但缺乏专业的技术支持和定制化能力。

爱诗科技的核心壁垒在于“数据飞轮”和“工程闭环”。数据飞轮方面,PixVerse和拍我AI每天产生数百万次用户生成请求,这些请求中的“成功案例”(用户满意的视频)和“失败案例”(用户不满意的视频)被自动收集并用于模型迭代。例如,当用户反复调整某个物理参数(如重力)时,系统会记录这个参数的变化趋势,并用于优化物理引擎的默认值。工程闭环方面,爱诗科技拥有从模型训练、推理优化到产品部署的全栈能力,这使得他们能够快速响应客户需求。例如,一家游戏公司要求生成“角色在月球表面跳跃”的视频,爱诗科技可以在48小时内调整物理引擎的引力参数并部署到API中。

然而,29.8亿元的融资也带来了巨大的压力。这笔资金相当于爱诗科技2025年全年营收的10倍(据估算,其2025年营收约为3亿元)。这意味着投资者期望公司在未来12-18个月内实现指数级增长。为了达到这个目标,爱诗科技必须同时解决三个问题:第一,降低计算成本。世界模型的计算量是传统模型的5-10倍,如果成本无法降低,B端客户可能难以承受。第二,扩大客户群。目前爱诗科技的B端客户主要集中在广告和游戏行业,需要拓展到影视、教育、医疗等新领域。第三,应对监管风险。AI视频生成可能被用于制造虚假信息,各国监管政策正在收紧。

战略发展与关键挑战:12-18个月的“生死时速”

未来12-18个月,爱诗科技将面临三个关键里程碑和三个潜在风险。

里程碑一:2026年底前推出“实时交互视频”产品。 目前PixVerse的生成速度约为30秒生成10秒视频,距离“实时”还有差距。爱诗科技计划在2026年Q4发布“PixVerse Live”,支持用户通过语音或手势实时控制视频内容。例如,用户说“把苹果向左移动”,视频中的苹果会立即向左滚动。这需要将世界模型的推理延迟降低到100毫秒以下,同时保持物理一致性。

里程碑二:2027年Q1实现B端客户营收占比超过50%。 目前爱诗科技的营收主要来自C端订阅,占比约70%。公司计划通过定制化解决方案和API服务,将B端营收占比提升至50%以上。这需要建立一支强大的销售团队,并开发针对特定行业的垂直模型(如“汽车广告专用模型”、“游戏角色动画模型”)。

里程碑三:2027年中完成对“长视频”的突破。 目前爱诗科技的世界模型可以生成最长5分钟的视频,但超过3分钟时,物理模拟的误差会开始累积。公司计划通过引入“分层模拟”技术——将长视频拆解为多个短片段,每个片段独立模拟,再通过“因果链接”拼接——实现10分钟以上的视频生成。

风险一:算力成本失控。 世界模型的计算量巨大,如果GPU价格持续上涨或供应链受限,爱诗科技的毛利率可能从目前的60%降至30%以下。公司正在探索使用国产芯片(如华为昇腾)进行推理,但性能尚不稳定。

风险二:竞争对手的“降维打击”。 OpenAI的Sora如果开放API,可能会以更低的价格提供类似功能。爱诗科技需要依靠“物理正确性”的差异化优势来抵御竞争,但OpenAI可能通过收购或自研来快速追赶。

风险三:监管黑天鹅。 欧盟《人工智能法案》和美国《AI视频生成透明度法案》可能要求所有AI视频添加水印并接受内容审核。爱诗科技需要投入大量资源开发合规技术,这可能会拖慢产品迭代速度。

核心判断

核心判断:爱诗科技正在用29.8亿元赌一个“物理正确”的未来。未来12-18个月,核心观察指标有三个:一是PixVerse Live的实时交互能力能否达到100毫秒延迟;二是B端客户营收占比能否突破50%;三是世界模型的计算成本能否降低至传统模型的2倍以内。如果这三个指标全部达成,爱诗科技将确立AI视频生成赛道的“物理标准”,成为行业基础设施。如果任何一个指标失败,它可能被OpenAI或Google的通用模型碾压。这场豪赌的结局,将决定AI视频是从“娱乐工具”进化成“生产力工具”,还是永远停留在“玩具”阶段。

RECODEX PARTNERSHIP
你的项目,下一篇值得报道
RecodeX 为 AI×Web3 早期项目提供从深度报道到融资撮合的全链路服务。三档方案,按阶段匹配。