原创报道
2026.07.11 20:49 约 13 分钟 AI人工智能 1.6万 阅读

快手可灵(Kling AI)拟完成新一轮20亿美元融资:估值达150亿美元,中美资本罕见共谋视频生成“价值之战”?

项目速览
项目名称 可灵(Kling AI)
融资轮次 战略融资 / A轮(分拆后首轮)
融资金额 20亿美元(最高可扩展至30亿美元)
投资方 CPE源峰、国方资本、阿布扎比BlueFive Capital、腾讯投资、中关村科学城基金、中信证券

随着全球生成式AI从单模态向多模态的深度跃迁,视频生成领域正迎来有史以来最大规模的单笔融资。据透露,快手旗下的视频生成大模型可灵(Kling AI)已接近完成一轮高达20亿美元的独立融资,投前估值达到惊人的150亿美元。这笔交易不仅是2026年全球AI领域最引人注目的资本事件之一,也是自多模态技术爆发以来,中国本土大模型团队所获得的最大体量资金注入。

此次融资案的投资方阵容堪称豪华,共吸引了至少38家机构参与,呈现出罕见的“国家队、传统互联网巨头、中东主权资本与海外成长基金”共谋的局面。据悉,本轮融资由CPE源峰、国方资本、阿布扎比BlueFive Capital、腾讯投资、中关村科学城基金以及中信证券联合领投,阿里巴巴、百度等国内大模型领域的直接竞争对手也以战略投资方的身份低调参股。更令市场关注的是,美国成长型私募巨头通用大西洋投资(General Atlantic)在经过多轮考量后,亦选择出资跟投。在当前复杂的地缘博弈背景下,美国一线资本对中国前沿AI独角兽的巨额押注,无疑释放出了极强的风向标信号。

信息维度 详情内容
公司名称 可灵(Kling AI)
公司主体 北京快手科技有限公司旗下独立分拆主体
创始人/核心带头人 宿华(顾问/前快手CEO)、程一笑(快手董事长兼CEO)、陈国创(快手AI团队负责人)
总部所在地 中国北京
成立时间 2024年(大模型立项),2026年独立分拆运作
本轮融资金额 20亿美元(最高可扩展至30亿美元)
本轮融资轮次 战略融资 / A轮(分拆后首轮)
本轮投前估值 150亿美元
联合领投方 CPE源峰、国方资本、阿布扎比BlueFive Capital、腾讯投资、中关村科学城基金、中信证券
战略跟投方 阿里巴巴、百度、工商银行、建设银行、通用大西洋投资(General Atlantic)等共计38家机构
核心产品与定位 拥有自主知识产权的物理级3D时空生成大模型,主打超强性价比与音视频多模态同步生成,对标OpenAI Sora及Luma AI
官网链接 klingai.com

快手分拆与“超级独角兽”的诞生:20亿美元融资如何重塑全球视频生成格局?

在可灵大模型完成这笔20亿美元的巨额融资前,全球视频生成领域几乎被美国头部团队所垄断。从OpenAI在2024年抛出震撼性的Sora,到Runway Gen-3的快速迭代,再到Luma AI凭借Ray系列模型在物理拟真度上的突飞猛进,硅谷在这一赛道的技术溢价与资本集中度令人侧目。然而,可灵的这笔交易瞬间打破了原有的均势,宣告中国前沿AI力量正式以“超级独角兽”的姿态加入这场终极格局的博弈。

要理解可灵为何能够承载150亿美元的估值,必须回到快手对多模态大模型的战略布局。与字节跳动、腾讯等巨头相比,快手在底层的通用大语言模型(LLM)研发上动作并不算最快,但在短视频和直播生态的浸润下,快手对“图像-视频-音频”这种多模态数据的理解和积累拥有无与伦比的天然优势。快手内部的AI团队很早就意识到,短视频生产本质上是视频生成的完美练兵场。从2024年下半年可灵在快手App内部开启测试,到随后推出独立的Web和App版本,可灵凭借对中国本土文化场景的细腻刻画、出色的中文指令理解能力以及稳定的动态构图,迅速在创作者群体中建立起极高的声誉。

然而,在快手庞大的集团架构内,多模态大模型的研发需要消耗海量的算力和资金,这对于正处于利润释放期、需要向二级市场证明盈利能力的快手集团而言,是一个沉重的财务负担。分拆,成为了可灵走向市场化发展的必然选择。

“可灵的独立分拆是一次高超的战略腾挪。”一位接近快手核心管理层的人士透露,“通过将AI视频生成业务剥离,快手不仅减轻了集团财报的算力折旧压力,更赋予了可灵独立从全球资本市场汲取营养的自由度。这笔20亿美元的资金,将保证可灵在未来三年内无需为算力账单发愁,可以全额投入到算法创新与全球化市场的争夺中。”

从全球视频生成格局来看,可灵的异军突起正值“Sora光环消退”的窗口期。OpenAI的Sora虽然名声大噪,但由于算力成本过高、物理规则理解的幻觉问题难以克服,其商业化落地进展缓慢,甚至一度推迟了对大众用户的全面开放。与之相对,Luma AI、Runway等新锐力量虽然保持了高频迭代,但受限于资金体量,难以进行动辄数万张显卡的超大规模集群训练。可灵在这轮融资后所获得的资金储备,已经超越了Runway和Luma AI的总和,直接跨入了与OpenAI、Google同等量级的“万卡俱乐部”。这不仅是一次商业层面的融资,更是一次在底层算力和模型规模上对硅谷顶尖AI公司的“饱和式追赶”。

38家投资机构的“国家队+跨国资本”拼图:腾讯、阿里、中东主权基金与美国GA的利益交织

可灵本轮20亿美元融资的背后,是一场极其精妙的资本协调与利益共谋。在当前地缘政治日趋复杂的背景下,能够同时将中国政府背景基金、本土互联网宿敌、中东主权财富以及美国成长型基金聚拢在同一张桌子上的项目,在全球范围内都屈指可数。

本轮融资的领投方之一——阿布扎比主权基金旗下的BlueFive Capital,代表了中东资本在AI时代的最新动向。与以往单纯追求财务回报的被动投资不同,中东主权资本如今更看重AI基础设施与技术向本地的迁移。据悉,BlueFive Capital在出资的同时,与可灵达成了一项战略框架协议:可灵将在阿布扎比建立其中东研发与云服务中心,利用中东充足且相对廉价的电力资源,合作建设面向欧洲与北非的AI视频生成算力集群。这种“资金换算力、资本换落地”的合作模式,为中国AI独角兽开辟了一条全新的全球化路径。

而在国内方面,腾讯和阿里的同时入股,则折射出中国互联网巨头在多模态AI时代的危机感与防御性策略。

投资方类型 代表机构 核心诉求与战略协同
国家队与地方基金 国方资本、中关村科学城基金、中国建银投资 确保前沿多模态AI技术的主权安全与本土产业链可控,推动AI与传统制造业的融合
互联网与产业巨头 腾讯投资、阿里巴巴、百度 防御性布局,获取前沿多模态模型底层接口,同时在云服务(阿里云、腾讯云)领域争取可灵的算力采购
中东主权资本 阿布扎比 BlueFive Capital 引进先进的AI应用技术,推动中东本地数字化转型及主权算力中心建设
海外成长型基金 通用大西洋投资(General Atlantic) 押注中国在多模态AI领域的应用端创新,获取具有超高性价比的AI核心资产股权
国家大行与金融机构 工商银行、建设银行、中信证券 提供多元化的债权融资与资本市场通道,为未来的全球化IPO铺平道路

值得深思的是美国通用大西洋投资(GA)的加入。作为全球顶级的私募成长基金,GA在字节跳动、希音(Shein)等中国全球化企业的成长历程中曾扮演过关键角色。在当前美国政府对华AI投资限制措施逐步收紧的敏感节点,GA通过其境外合规主体参股可灵,不仅彰显了其对可灵技术实力和商业化前景的极高认可,也表明在前沿科技领域,全球顶尖资本对具有“全球化潜力”的中国资产依然抱有强烈的投资渴望。可灵在股权架构上的中外合资设计,也为其未来走向全球市场、规避地缘监管风险提供了宝贵的缓冲带。

“性价比之王”的技术密码:快手可灵在音频生成与成本控制上的护城河

在多模态大模型的竞争中,“技术领先一步”固然重要,但“商业化成本降低十倍”往往才是决定最终胜负的关键。可灵在推出之初,就被业内冠以“价值冠军”(Value Champion)的称号。与Luma AI Ray 3.14模型每次生成视频需要消耗数美元的算力成本相比,可灵通过底层的技术创新,将单次生成成本控制在竞争对手的五分之一以下。

这一性价比优势的核心,在于可灵对Diffusion Transformer(DiT)架构的深度优化。传统的视频生成模型在处理长时间、高分辨率的视频时,计算复杂度会随着视频帧数呈指数级上升。可灵的技术团队提出了一种创新的“时空注意力机制解耦”方案,将三维空间的计算拆分为一维的时间注意力和二维的空间注意力,在保证视频前后帧一致性的同时,大幅度降低了GPU的显存占用和计算延迟。这使得可灵可以在单张H800或A100显卡上,实现接近实时的视频预览生成,极大提升了算力利用率。

“在AI时代,性价比就是生命线。”可灵AI负责人陈国创在一次行业技术分享中指出,“如果一个创作者生成一段10秒的视频需要花费10块钱,那么这个技术就只能停留在广告等极少数高毛利行业;只有把成本降到2毛钱甚至更低,AI视频生成才能真正融入到日常内容创作、游戏开发和社交娱乐中。可灵的所有算法优化,都是为了无限逼近这个物理成本的极限。”

除了成本护城河外,可灵在多模态协同生成上的另一张王牌是原生音视频同步生成(Native Audio-Video Generation)。目前的视频生成大模型,大多是“无声电影”——模型只负责生成画面,声音则需要创作者在后期通过其他音频模型或素材库手动配乐和对齐。而可灵在训练之初,就将音频信息与视频信息作为同一个时空序列进行联合建模。

这带来的最直接技术突破,就是极具拟真度的多语言唇形同步(Lip-Sync)。当用户输入一段人物说话的文本和视频提示词时,可灵生成的角色不仅面部表情自然,其嘴部肌肉的收缩、舌头的运动轨迹能够与生成的声音信号达到毫秒级的精准匹配,甚至支持中、英、日、法等十余种语言的口型转换。这一功能在影视本地化译制、虚拟数字人主播、游戏NPC互动等场景中,展现出了颠覆性的应用价值。

局限性与代际差距:在Ray 3.14与Sora的夹击下,可灵的“物理世界理解力”还有多远?

尽管可灵在融资市场和性价比上取得了巨大的成功,但冷静的行业观察者必须指出,在通往“通用物理世界模拟器”的道路上,可灵与全球最顶尖的对手之间依然存在着客观的代际差距。

目前视频生成领域的技术皇冠,依然被Luma AI的Ray 3.14模型和OpenAI的Sora所占据。这种差距最直接地体现在对“物理世界规律的理解”上。视频生成大模型本质上是通过学习海量视频数据,来模拟三维空间中的重力、碰撞、光影折射、流体动力学等物理规律。在这方面,Luma AI的最新一代模型展现出了惊人的“物理直觉”——当模拟水杯坠落时,Ray 3.14能够精准渲染出玻璃破碎的瞬间、水流在大理石地面的蔓延路径以及碎片反射周围光线的动态变化。

相比之下,可灵在处理这类复杂的动态物理交互时,仍会出现较为明显的“幻觉”和物理失真。例如,在模拟人物穿衣、液体混合、复杂机械结构运转等场景时,可灵生成的视频中偶尔会出现肢体异常穿模、物体凭空消失或融合等不符合常理的现象。这表明,可灵在底层的物理引擎建模和三维空间一致性上,与硅谷最顶尖的“物理模拟器”相比,依然落后半代左右。

评测维度 可灵(Kling AI) Luma AI (Ray 3.14) OpenAI (Sora)
画面艺术感/构图 极佳,适合亚洲审美,色彩浓郁细腻 商业电影级,光影对比强烈,写实度极高 叙事感强,细节丰富,风格多变
物理世界规律模拟 较好,但在复杂交互(如碰撞、物体碎裂)中易失真 优秀,对重力、流体力学、材质折射有深刻理解 优秀,能够模拟长时序的复杂因果关系
原生音视频同步 优秀,支持多语言精准口型对齐与环境音合成 较弱,主要依赖后期配音对齐 无原生音频生成,需外部模型辅助
aspect ratio/分辨率 局限于16:9与9:16,缺乏更自由的裁剪比例 支持从2.35:1到1:1的任意比例构图 支持主流各种分辨率与画幅比例
控制力/关键帧控制 较弱,尚不支持高精度的轨迹控制和首尾关键帧锁定 极强,支持通过首尾双关键帧及3D相机路径进行精确控制 强,支持图像引导及局部区域编辑重绘
算力与API生成成本 极低(约$0.05/次),支持大规模商业并发 较高(约$0.25/次),API调用成本较高 极高,商业化部署成本高昂

除了物理规律的模拟能力外,控制力(Controllability)的缺失是限制可灵进入专业影视制作流程的另一大瓶颈。在好莱坞等专业制片场景中,导演需要对摄像机的运动轨迹、光影变化、角色的具体动作进行像素级的精准控制。Luma AI等模型已经引入了“双关键帧控制”(定义视频的起点和终点画面)以及“3D相机路径预设”功能;而可灵目前依然高度依赖自然语言提示词(Prompt)进行黑盒式的生成,创作者很难通过可灵实现可预期、可重复的精准镜头编排。

这些局限性决定了,可灵目前的主要市场依然集中在泛娱乐内容创作、营销广告、社交媒体等对物理精确度要求不高、但对生成速度和成本极其敏感的“大众消费级”场景。如何用这笔20亿美元的融资补齐“控制力”与“物理规律理解”的技术短板,是可灵能否实现从“好玩的视频玩具”向“生产力级别的影视工具”跨越的关键。

辩证终局:大模型泡沫期的大手笔,是烧钱无底洞还是中国AI的“诺曼底登陆”?

2026年,全球生成式AI行业正步入一个尴尬的“幻灭期”或“重塑期”。一级市场对大模型的疯狂追捧已然退潮,无数缺乏自我造血能力的AI包装公司在资金链断裂中默默倒下。在这样的节点上,可灵能够完成高达20亿美元的独立融资,这笔惊天交易的背后,究竟是中国多模态AI的底层胜利,还是一场更大规模算力泡沫的终极狂欢?

乐观者认为,可灵的这笔融资是中国AI力量在多模态赛道的一次“诺曼底登陆”。在底层大语言模型(LLM)领域,由于高质量英文数据的缺失和地缘算力封锁,中国团队一直在进行艰难的追赶。但在视频和3D生成领域,数据、场景和性价比是中国团队天然的强项。快手庞大的UGC视频库提供了取之不尽的训练语料,中国庞大的短视频与小游戏产业链则提供了全球最宽广的应用落地场景。可灵在降本增效上的极致追求,证明了中国团队可以将前沿AI技术迅速拉向工程化和产业化的深水区。这20亿美元将作为可灵的战略核燃料,支撑它在全球多模态标准制定中占据一席之地。

“多模态的战争本质上是工程与效率的战争。”一位关注大模型赛道的资深投资人指出,“硅谷擅长从0到1发明新的算法架构,但中国团队擅长从1到100将技术做到极致的便宜和易用。如果可灵能够凭借成本优势迅速占领全球开发者和创作平台,它就有机会像当年的TikTok一样,建立起一个基于中国AI底座的全球生态。这正是38家资本愿意在熊市中下重注的底层逻辑。”

然而,悲观的声音同样震耳欲聋。他们指出,视频生成大模型的商业模式至今未能形成真正的闭环。高昂的显卡折旧、电费开支以及带宽成本,使得每一次“点击生成”都在燃烧实实在在的现金。尽管可灵通过算法优化降低了单次生成成本,但在缺乏杀手级商业化场景的前提下,这种性价比优势很难转化为持续的利润。目前,可灵的付费转化率依然偏低,大多数用户仍停留在免费试用和低频尝鲜阶段。如果多模态技术无法在未来两年内突破专业影视或3D内容生产的瓶颈,这笔20亿美元的巨款,很可能会在建设计算集群、购买昂贵算力的过程中被迅速消耗殆尽,沦为算力巨头NVIDIA和各大云服务商的“隐形补贴”。

无论如何,可灵的这笔融资已经将中国多模态大模型的竞争推向了全新的高度。这不再是几十人团队的极客游戏,而是涉及百亿资本、万卡算力、地缘政治与产业博弈的超级战争。在这个残酷的角斗场里,可灵已经拿到了最充足的弹药,但决定它能否活到最后的,不仅仅是账面上的20亿美元,更是它在技术代际跨越与商业闭环验证上的速度。这场全球视频生成的终极价值之战,才刚刚拉开序幕。

分类与标签

分类: AI人工智能 标签: 可灵, Kling AI, 快手, 视频生成, 腾讯, 阿里巴巴, CPE源峰, 融资, AI大模型

RECODEX PARTNERSHIP
你的项目,下一篇值得报道
RecodeX 为 AI×Web3 早期项目提供从深度报道到融资撮合的全链路服务。三档方案,按阶段匹配。