原创报道
2026.08.07 02:46 约 14 分钟 AI人工智能 新发布

形界智维完成天使轮融资:流式视频生成如何重塑数字人与直播电商?

项目速览
项目名称 形界智维
融资轮次 天使轮
融资金额 金额未披露
投资方 光源资本

视频生成领域正经历一场静默的裂变。当行业仍在追求更高清的画质、更长的单次生成时长时,一个更根本的技术路径分歧已悄然浮现:究竟是继续打磨“输出整段视频”的快照式模型,还是彻底转向“流式输出”——让视频像对话一样实时生成、永不中断?这个问题并非单纯的学术偏好。在数字人直播、虚拟主播、实时互动的3D内容等商业场景中,延迟和连续性已成为比画质更致命的约束。一部宣传片可以等待数分钟甚至数小时的渲染,但一个正在卖货的数字人主播若在回答用户问题时卡顿三秒,交易可能已经流失。正是在这个技术与场景的断层线上,一家成立仅两个月、却在AI前沿社区声名鹊起的公司,获得了第一笔筹码。

2026年8月,北京形界智维科技有限公司(以下简称“形界智维”)确认完成天使轮融资。光源资本宣布对这家公司进行投资。尽管公司及投资方均未正式披露具体交易金额,但多条第三方信息显示,其融资规模可能达到“数千万元”级别,且在成立首月即已完成账目交割。在创投市场整体趋于审慎的当下,这一速度几乎等于资本直接在技术白皮书上签了字。

字段 内容
公司 北京形界智维科技有限公司
轮次 天使轮
金额 未披露(第三方信息称数千万元)
投资方 光源资本
总部 北京市朝阳区
创始人 王裕鑫
官网 未披露

学神级团队的“登顶”路径:从Hugging Face日榜到资本押注

形界智维的技术底色,在其创始人王裕鑫身上有鲜明印记。在2026年世界人工智能大会(WAIC)Future Tech的官方报道中,这家公司被列为年度175个早期突破性项目之一,王裕鑫的名字与一个罕见的背书并列——其团队被Web开发框架Django的作者、国际知名技术专家Simon Willison评为“2025年国内Top6大模型团队”。这个评价在技术圈内的分量,不亚于在投资圈拿到一线基金的领投。

真正让形界智维从学术圈走向资本视野的,是其两项核心研究成果:Stream-R1和Stream-T1。这两个模型曾在全球最大的开源模型平台Hugging Face上“日榜包揽冠亚军”。在一众追求单帧分辨率或文本转视频长度的SOTA(State-of-the-Art,最优性能)模型中,这两个模型的脱颖而出,指向了视频生成技术的一个新维度——实时连续生成与推理能力。这种技术卡位与此前一批研究型团队的路径形成微妙对比:当多数人沿着DiT架构的纵深做参数规模的线性扩展时,形界智维选择在时间轴上重构生成逻辑,将“推理”这一动作本身作为生成过程的核心组件。

据WAIC现场材料和早期报道的描述,形界智维的“流式视频生成”技术并非简单的将现有DiT(Diffusion Transformer)模型加速,而是一个融合了大模型推理、视频生成与智能体(Agent)能力的实时架构。通俗来说,传统视频生成是“先想好整个故事再全片导出”,而形界智维的做法是“一边想一边演,还能根据观众的实时反馈改剧本”。这种架构上的根本差异意味着,模型不再是一次性的“创作工具”,而更接近一个具备上下文理解、决策与执行能力的“数字演员”。

一个被多家媒体反复提及的细节显示,公司在2026年6月9日正式注册成立,当月便有数千万元融资到账。企查查数据显示,公司注册资本为100万元,但在相关工商信息披露抓取中出现了“融资金额:数千万元”的描述。这种成立即获重注的节奏,表明本轮融资在团队以实验室或项目组形态运转时便已基本敲定,公司注册更像是一个法律上的交割节点。这也意味着,光源资本的决策过程可能更多基于对王裕鑫团队过往研究产出的跟踪评估,而非对一家已成型公司的尽职调查。在AI投资日益机构化的今天,这种“投人、投论文、投开源社区声誉”的逻辑,正成为一种越来越常见的早期交易形态。

拆解流式生成:为什么说它是一场实时交互的技术革命?

要理解形界智维的价值主张,需要先看清当前视频生成的主流范式及其边界。以Runway、Pika,以及国内的快手可灵、字节即梦等为代表的视频生成模型,尽管在生成质量、语义对齐和时长上快速迭代,但其底层逻辑仍属于“离线生成”。用户输入一段提示,模型经过数十秒甚至数分钟的推理,输出一段几秒到几十秒的视频。这个过程是单向的、封闭的。如果一段直播需要持续数小时且每一帧都要实时响应用户的弹幕提问,这种架构即宣告失效。原因在于,离线模型的推理成本和延迟与生成内容的长度、复杂度是强相关的,无法满足对低延迟、高连续性的实时场景需求。

流式视频生成,则试图将视频输出解耦为连续、渐进的帧序列流。这要求模型不仅能预测下一帧画面,更要基于实时传入的语音、文字、动作捕捉等信号,动态调整后续内容。在WAIC的报道中,形界智维的技术被描述为“将大模型推理、视频生成和Agent能力深度融合”,其关键词正在于此:推理能力赋予了模型理解上下文、执行复杂指令的逻辑,Agent框架使其能够调用外部工具和记忆,而流式生成管道则负责将这些决策实时“渲染”为连贯的视频画面。这三个模块的协同,意味着系统在生成每一帧时,都在执行一个“感知-决策-表达”的微型闭环。

一个更直观的类比或许来自它被反复提及的应用领域:数字人与直播电商。现有的数字人直播方案,本质上是通过预先录制的视频片段、简单的口型匹配和预设的问答库拼合而成,面对复杂或边缘问题极易“破功”。流式视频生成技术如果成熟,意味着数字人的动作、表情、口型乃至所处的背景环境,都能根据大模型实时生成的对话内容,实时以前后连贯的方式“演”出来,不存在任何预录片段的中断感。从Hugging Face的日榜表现来看,Stream-R1与Stream-T1很可能在推理效率与生成连贯性这两个关键指标上,提供了一种新的基线。其在开源社区获得的关注表明,研究同行对“流式”这一方向的可行性投出了信任票。

不过,从研究原型到可商用的产品,形界智维面前横亘着视频生成领域共同的工程化难题。首当其冲的是计算成本与延迟的平衡。连续生成视频对算力的消耗是指数级的,保持实时性意味着必须依赖极高效的推理框架和可能的边缘端算力适配。其次,在长程生成中如何维持语义一致性,避免模型“忘了”几分钟前自己生成的内容或做出的承诺,是Agent记忆系统的核心挑战。此外,多模态输入信号(语音、文本、视觉)如何在推理空间中被有效对齐,也直接决定了数字人在交互过程中的反应准确度。这些坑,每一个都足以将一个看似惊艳的Demo阻挡在产品化的大门之外,形界智维如何跨越这些工程鸿沟,目前尚未有公开技术细节披露。

商业模式悬置,资本押注的是底层基础设施的话语权

本轮融资最微妙的地方,在于公司的商业化意图至今“未披露”。在不同渠道的报道中,形界智维被划归为“科技推广和应用服务业企业”,主营业务描述宽泛且公式化。它的官网未公开,客户名单空白,具体的价格策略和落地场景更在外界视野之外。

这令光源资本此次的押注,更像是一笔典型的技术赛道底层基础设施投资。其逻辑与多年前押注Spark、Flink等实时计算引擎的思维相似:在确定性的大趋势(实时内容生成)到来前,占领技术架构的定义权。在流式视频生成这条极细分的赛道上,目前尚未出现占据主导地位的框架或平台,这意味着一个短暂的窗口期——谁先跑通从模型到推理引擎再到开发者工具链的完整闭环,谁就有可能定义这个新管道的交互标准与接口规范。

行业背景为此提供了支撑。2026年的WAIC上,包括蓝驰创投、软银中国、Monolith等在内超过100家投资机构进场扫货早期AI项目,现场数据显示意向订单总额高达2.68亿元,而超七成团队成立不足三年。资本的集体行动显示出一个共识:AI投资正从追逐大模型公司、拼参数,转向寻找那些能在关键细分节点重构“管道”的项目。流式生成作为连接大模型推理能力与真实世界交互需求的咽喉,正是此类节点。它位于模型层和应用层之间,解决的是“从智能到实时交互体验”的最后一公里问题。

光源资本的投入,可能意味着形界智维将沿着一条开源或半开源的路径,先成为数字人、实时互动内容工具、下一代直播平台的中游技术供应商。一旦其流式生成架构成为事实标准或主流选择,商业化的机会可向后延伸至推理算力优化、企业级订阅、甚至根据实时生成流量消耗进行分成等多种模式。这种路径选择也与团队的开源基因契合——通过在Hugging Face等社区持续输出有影响力的模型,吸引开发者生态,形成技术标准的网络效应,然后再从生态中提取商业化价值。

然而,“成立即融资”的速度背后,也带来一个典型的创始人困境:王裕鑫和他被评价为Top6的团队,需要在极短的时间内,完成从顶尖研究团队到能交付工程化产品的公司的蜕变。技术极客文化下的快速迭代,能否转化为满足企业客户对稳定性和服务支持的预期,是天使轮之后第一份现实考卷。研究团队通常以攻克学术指标为导向,而公司则需要以客户需求的稳定性和可靠性为导向,这两者之间在文化、流程、人才结构上的张力,将是形界智维组织建设中的核心挑战。

在数字人赛道的混战中,一个根本性的路线分野

形界智维所处的竞争环境,并非一片无人区,但它的技术路线指向了一条与当前主流玩家截然不同的岔路。当前的数字人和虚拟直播赛道拥挤但层级分明。底层是提供算力和通用大模型的云厂商;中间层是美国NVIDIA的Omniverse为代表的图形渲染平台,以及国内众多基于传统CG(计算机图形学)和动捕方案的数字人制作工具;上层应用则是像谦寻、美ONE等MCN机构推出的带货数字人,或者B站上由A-SOUL等团队运营的虚拟偶像。

这些现有方案高度依赖昂贵的动作捕捉棚、精细的三维建模师,以及海量的预渲染。其产出的视频本质上仍是“存量剪辑”。形界智维的流式生成方案,如果能将成本降至实时推理级别,将直接解构现有的CG工作流——不再需要“建模-绑定-渲染”的离线流程,而是由模型实时生成每一帧。这不再是对现有方案的优化,而是一次替换。从生产关系的角度看,这意味着一场剧烈的去中介化:传统CG产业链上大量的建模师、动画师、渲染工程师的重复性劳动,可能被一套推理集群所吸收。这种冲击的深度和广度,决定了它既充满颠覆性想象空间,也必然在产业落地的过程中遭遇来自既有利益格局的阻力。

但这种路径的挑战同样明确。在CG方案数十年积累的绝对画质和可控性面前,纯生成式方案在人物面部细节、光线物理一致性等精细度上仍可能“露怯”,更容易在长直播中产生不可预测的“幻觉”画面。此外,快手、字节等掌握着大量视频数据和海量算力的巨头,并非没有能力将“流式”概念纳入自己的可灵、即梦等模型迭代路线中。一旦巨头决定将内部产品化能力与流式研究结合,形界智维作为独立公司的窗口期将取决于它的技术领先幅度与生态捆绑速度。这种领先幅度,不能仅仅是发表论文和开源模型的时间差,还必须固化为开发者难以迁移的工具链依赖、领域数据飞轮或成本结构优势。

光源资本的这笔投资,也可以被解读为在巨头包围下,一次为潜在收购或生态卡位做的前置动作。在科技巨头的AI军备竞赛中,通过早期投资锁定具备关键节点技术的团队,为未来可能的战略整合保留优先权,已成为一种常规操作。形界智维的流式生成架构,恰好处于大模型能力与实时交互应用之间的咽喉位置,其战略价值可能远超其短期的独立商业化前景。

资金将流向哪里:研发投入的具体拆解与未知的客户地图

根据DoNews报道中公司的表述,本轮融资的核心用途有三:技术研发、团队扩充及市场拓展。这三点在早期公司中看似标准,但结合形界智维的实质,每一笔钱的去向都暗含具体的技术博弈。

“技术研发”最直接的含义,大概率是对Stream系列模型的长帧连续生成一致性的持续攻关,以及将其从“跑通demo”优化到“能落地商用的低延迟推理引擎”。这必然涉及大量的GPU算力租赁或采购费用,以及招募能对Transformer和Diffusion模型进行极致推理优化的系统工程师。具体而言,可能需要在模型剪枝、量化、投机采样、算子融合等推理优化方向上做工程投入,同时也要在长序列记忆的检索增强生成(RAG)或状态空间模型等架构层面进行探索,以确保数字人在长达数小时的直播中不产生灾难性遗忘。

“团队扩充”则从侧面证实了公司目前处于由研究小组向结构化团队转型的初期。企查查显示公司核心主要人员尚仅列明王裕鑫一人。接下来的招聘将决定公司是继续偏重研究,发布更多类似Stream-R1/T1的学术成果以巩固社区地位,还是迅速偏重产品工程,为某个具体的行业(如直播电商)打造第一套可交付的流式视频生成工具。这一选择将深刻影响公司的组织形态和短期内的关键考核指标。如果选择前者,团队可能需要继续引入具备顶尖学术背景的研究员;如果选择后者,则更需要具备分布式系统、流媒体传输、移动端适配经验的工程师。

而所有用途中最具不确定性的部分,是“市场拓展”。在没有明确商业化方案的情况下,这笔预算更可能用于拓展与头部直播平台、大型零售品牌或政务数字人项目的初步试点合作。这也是形界智维走出WAIC的展厅,验证其技术能否在嘈杂、多变的真实直播间而非可控制的benchmark数据集上解决问题的第一步。在直播电商场景中,照明变化、网络抖动、突发噪声、多机位切换等不确定性因素,将对模型的鲁棒性提出远超实验室环境的考验。这些试点项目的数据反馈,可能会成为团队调整模型架构和产品化方向的关键输入。

技术理想主义遇上产业约束:天使轮未能回答的待验假设

巨额资本为极早期的技术飞跃欢呼的同时,形界智维需要直面几项将在A轮前被反复审视的核心假设。

第一项假设:实时推理的成本能低到被直播电商场景接受。 目前,头部数字人直播的毛利率仍高度依赖于降低计算资源成本。如果生成一秒逼真的数字人视频所需算力费用高于真人主播的时薪,商业模式将难以成立。形界智维未公布其单帧或单秒生成成本的经济性数据,这是其商业叙事中最需要被补上的拼图。以一个典型的日播直播间为例,单日可能需要连续生成数小时的视频流,计算成本如果做不到显著低于真人主播的薪酬,其价值主张将面临根本性动摇。

第二项假设:其技术护城河足以对抗闭源与开源的夹击。 Stream-R1和Stream-T1在Hugging Face的日榜登顶,证明了其在开源社区的吸引力,但开源本身是可复制和可改进的。公司如何在保持社区影响力与构建商业化专有技术之间取得平衡,将决定其是否会沦为巨头的“技术输血者”。一个可能的路径是,在维持基础模型的开放性的同时,将关键的数据处理管线、针对特定场景的微调策略、以及与推理引擎高度耦合的调度系统作为闭源的商业层。

第三项,也是最根本的一项:流式视频生成本身,能否成为客户愿意支付溢价的独立产品,而非大模型能力的一项默认功能。 如果未来一到两年,OpenAI的Sora或Google的Veo直接在更新中加入“实时生成”按钮,独立公司的价值主张将面临降维打击。形界智维必须证明,其整合了“推理+生成+Agent”的流式架构,提供的不只是更快的生成,而是一种全新的、在离线模型里无法复现的实时交互能力。这或许意味着,其价值不在“生成”本身,而在于“生成过程中对外部信号的实时理解和反馈”所形成的闭环体验——这种能力可能并不容易被简单的工程优化所追赶,因为它涉及根本性的模型架构选择。

该公司目前唯一可被外部观测到的指标,是它在一个属于极客的技术社区中获得的尊敬。Hugging Face的日榜、Top6团队的荣誉,这些都是“同行认可”而非“市场认可”的信号。天使轮买的,恰恰是这个从“同行认可”到“市场认可”的转换期权。这也意味着,这是风险投资中典型的高信息不对称、极高潜在回报但也极高失败概率的押注。形界智维接下来的每一步,都需要将论文中的实验数据,翻译成可被客户感知的生产指标;将Hugging Face的星星数,转化为真实场景中的留存率和续费率。这个转换过程的效率和成功率,将是决定这轮投资最终成色的唯一标准。

RecodeX 极客视:形界智维的故事,几乎是当下AI创投趋于技术底层化的一个范本。当市场对“大模型六小虎”的估值游戏感到疲倦,一群刚从实验室走出的年轻人,凭借两篇登上Hugging Face日榜的研究,让资本在巨头合围之前抢先为一项可能重新定义视频生成的架构下了注。光源资本投资的不是一份商业计划书,而是对未来数字世界内容供应链断层的一次预判。在离线生成的延长线上,行业已拥挤不堪;而流式生成这条新路,虽然布满了算力成本、长程一致性和工程化落地的未爆弹,却也提供了难得的定义权的可能性。这笔账能否算通,最终不取决于它在技术社区中的日榜排名能保持多久,而在于王裕鑫的团队能否在技术极客的纯粹和产业落地的混沌之间,走出一条从未有人成功过的路——让视频像水一样流动,也让现金流进来。

RECODEX PARTNERSHIP
你的项目,下一篇值得报道
RecodeX 为 AI×Web3 早期项目提供从深度报道到融资撮合的全链路服务。三档方案,按阶段匹配。