形界智维完成数千万级首轮融资:流式视频生成能否定义实时互动视频?
一场实时竞速正在取代视频生成领域的“静态美学”比拼。当Runway、Pika等工具已经让“文生视频”变得不再稀奇,一个更激进的问题开始浮现在创业者的雷达上:视频生成能否从离线走向在线?在胡须纹理、物理轨迹和光影细节被反复雕琢近两年后,质量逐渐逼近天花板,但速度能不能快过人类的等待耐心?传统AI视频生成遵循“输入指令—等待渲染—输出片段”的离线逻辑,哪怕是最先进的模型,也需要数十秒甚至数分钟才能产出一条可用视频。人类对交互延迟的容忍阈值约在100至200毫秒,这种延迟在直播、实时对话、互动叙事等场景中,形同将AI剔除出局。形界智维给出的解题思路是“流式视频生成”——让视频像聊天一样实时产生、连续续写,每一帧都在推理,每一秒都在生成。
这并不是一个无人思考过的方向,但率先拿出系统级方案的团队屈指可数。就在行业对这一技术路线的可行性争论不休时,一家成立仅一个月的公司完成了数千万级首轮融资,试图将“实时交互式视频”从学术Demo推进到可商用的产品平台。值得注意的是,这笔融资的到账时间甚至早于公司注册日,暗示资本赌的并非一个已经验证的商业模式,而是一个技术拐点的提前卡位。
这家公司就是形界智维。创始人王裕鑫带领的团队,在WAIC 2026上展示了将大模型推理、视频生成与Agent能力融为一体的技术架构,其学术研究成果在Hugging Face日榜包揽冠亚军。现在,这笔资金将用于加速驱动一款名为framex-ai的互动视频生成平台。
| 公司 | 北京形界智维科技有限公司 |
| 轮次 | 天使轮(IT桔子记录为“未披露”) |
| 金额 | 数千万级人民币 |
| 投资方 | 光源资本;其余投资方未披露 |
| 总部 | 北京市朝阳区 |
| 创始人 | 王裕鑫 |
| 官网 | https://www.framexstudio.ai/ |
从Hugging Face日榜冠军到一家新公司,流式视频生成是条什么路
2025年某天,Hugging Face的日榜上出现了两个陌生的名字:Stream-R1和Stream-T1。这两个开源项目在一天之内包揽了日榜冠亚军,其背后的核心技术正是“流式视频生成”。在那个时间节点,大多数AI视频生成研究仍在追求更高分辨率、更长时长和更稳定的时空一致性,而这两个模型已经将关注点转向了“生成速度与实时交互”——它们不再把视频生成看作一次性输出,而是设计成了一套可以持续推理、逐帧输出的系统。Hugging Face作为AI开源社区的风向标,日榜冠军能带来可观的关注度,但榜单热度与工业级可用性之间的鸿沟,仍需工程化来跨越。
模型的提出者,就是当时尚未正式成立公司的王裕鑫团队。根据WAIC 2026 Future Tech板块的信息,该团队被Django框架作者、知名技术专家西蒙·威利森评为2025年国内Top6大模型团队。这一评价本身并不构成投资建议,但它提供了一个侧面信号:这支团队的技术基础得到了海外技术社区的部分认可,至少在起跑线上具备了一定的学术辨识度。
形界智维当前的技术架构,正是延续了Stream-R1和Stream-T1的研究方向,将三个模块缝合在一起:大语言模型的连续推理能力、扩散模型的视频生成能力、以及Agent的决策调度能力。根据已有信息推测,其核心逻辑可能是:Agent接收外部输入(如用户指令、环境反馈),大模型实时理解语境并生成下一帧的自然语言描述,视频生成模块再将该描述渲染为画面,整个流水线以流式方式运转,打破“等待完整视频”的离线模式,实现“生成即交付”。这个过程里,大模型类似大脑,扩散模型像画笔,Agent则充当导演,掌控叙事节奏与镜头语言。三者的协同需要毫秒级的精准编排,任何一环的延迟都会被累积放大;同时,长时生成下人物形象一致性和场景逻辑的连贯性,仍可能是该架构面临的系统级挑战,因为逐帧迭代容易引入微小的累积误差,最终导致画面漂移。目前公开材料仅描述了技术方向,没有披露这种架构在长时生成下的稳定性、生成质量衰减曲线,以及Agent调度在大规模并发下的性能表现。这些细节将直接影响这家公司商业化的真实能力。
光源资本入局,但这笔钱的逻辑比“天使”更复杂
这轮融资的资本结构,是一个比数字本身更值得解读的信号。亿欧数据用明确的措辞写道“光源资本宣布完成对北京形界智维科技有限公司的天使轮投资”,企查查也将轮次标注为天使轮,金额为数千万元。然而,另一家创业数据平台IT桔子对同一事件的记录是“轮次未披露”。DoNews的快讯则含糊其辞,既未指明轮次也未公开投资方。
这种信息的不一致,并非数据服务商之间的简单疏漏。它可能折射出一个现实:这笔融资的交易结构比较复杂,或许包含多轮交割、多种金融工具,或者部分投资方设定了未公开的前提条件。例如,交易可能嵌入了可转换债券、基于里程碑的追加投资或估值调整机制,使得纯粹以“天使轮”定义不够精确。光源资本作为公开的投资方,其投资逻辑值得拆解。以FA(财务顾问)起家的光源资本近年来开始用自有资金进行早期布局,天使轮直投案例并不多见。光源选择在形界智维成立首月、甚至产品尚未正式推出之前就注入资金,说明它押注的不是当前的产品形态,而是王裕鑫团队的技术方向和视频生成赛道代际切换的窗口期。对于一家以撮合见长的机构,亲自下场往往意味着对赛道终局的强烈判断,但同时也将其自身暴露在早期项目固有的高失败率之下。
企查查显示,这笔融资的时间节点为2026年6月8日,而公司正式注册成立是在6月9日,即资金先于公司入场。这种操作方式在深科技领域并不鲜见,通常意味着投资方在团队还在实验室阶段时就已经完成尽调并锁定份额。对于外部观察者而言,这同时也是一个风险信号:投资决策高度依赖对创始人和技术路线的判断,而几乎不包含对公司运营、产品验证和市场需求的事实性评估。除了光源资本,其余投资方未公开,这意味着背后可能还有个人天使或专项基金,但其资源和后续支持力度无从得知。
framex-ai是一个平台蓝图,但“实时互动视频”需要先在真实场景着陆
融资公告中,形界智维的表述是:公司核心方向为AI视频生成,重点研发流式视频生成技术,主打产品为framex-ai互动视频生成平台。请注意,这里的关键词是“平台”,而不是“工具”或“模型”。
若仅作为模型,其商业路径无外乎打包API、按调用量收费。但平台的野心意味着,形界智维希望framex-ai能成为一个承载实时互动视频内容的生产与分发枢纽,让开发者和内容创作者在其上搭建具体的应用。WAIC报道中提到的潜在场景包括数字人直播和互动电商,这给出了两个可以想象的落地画面:直播间里,AI数字人的表情、口型和台词不再受预设动画脚本的限制,而是根据弹幕和观众行为实时生成;电商互动中,用户可以像玩游戏一样与AI角色实时对话,推动剧情和产品展示。要支撑平台形态,framex-ai不仅需要流式生成的核心引擎,还必须搭建账号体系、计费系统、内容审核、开发者文档和社区运营等一系列配套设施,这一工作对一家成立仅一月的公司而言,远比模型研发更为庞杂。
然而,从“想象场景”到“可交付产品”,framex-ai需要跨过的鸿沟并不小。首先,实时视频生成与传统的离线生成对算力调度的要求截然不同——它要求GPU集群能在毫秒级响应请求,且保持恒定的低延迟,成本控制难度是指数级上升的。其次,互动视频的本质不仅在于“快”,还在于“对”——Agent模块能否正确理解上下文并做出合理反应,决定了用户体验是惊艳还是滑稽。目前公司未披露任何产品Demo、客户案例或应用场景的验证数据,framex-ai的实际完成度和性能表现仍处于“未知”区间。倘若平台无法在某个垂直场景中给出超过传统实时渲染方案的性价比,用户付费意愿将很难被激发。
在大厂夹缝中起跑,对手不止是视频模型公司
形界智维面对的竞争格局,远比“AI视频生成赛道”这七个字所描述的更复杂。它将面临三层竞争力量的交错挤压。
第一层,是同样瞄准实时路线的视频生成公司。虽然公开材料未列明形界智维的直接竞品,但产业逻辑表明,任何掌握类似“流式”或“低延迟”生成能力的团队,都将与framex-ai争夺同一批直播、互娱和数字人客户。第二层,是已经拥有庞大用户和算力基础的大模型公司。快手可灵、字节PikaPika等产品虽然目前仍以离线生成为主,但只要其在流水线上加入流式推理模块,凭借其品牌、资金和场景优势,可以迅速覆盖形界智维的目标市场。更不容忽视的是,大厂掌握着海量视频数据和用户行为数据,这些对训练实时交互模型可能构成难以复制的数据护城河。第三层,是游戏引擎和传统实时渲染技术。在互动视频的下游应用中,基于规则的实时渲染(如Unreal Engine)仍是成本最低、可控性最强的方案,AI实时生成要替换它,需要在创造力和不可预测性上拿出压倒性的性价比优势,而这一点在成本曲线下降前并不明朗。
一个值得注意的事实是,快手可灵AI的核心骨干王鑫涛在2026年离职,他曾主导视频生成研发,也是Real-ESRGAN等知名开源项目的作者。这一变动可能意味着头部人才正在重新配置,给创业公司提供了短暂的招揽窗口,但同时也印证了AI视频赛道正处于剧烈震荡期,技术优势可能转瞬即逝。形界智维能否在这样的窗口期快速组建一支具备完整产业经验的团队,仍是一个悬而未决的命题。
钱要往哪里花,决定了这是一家模型公司还是平台公司
DoNews的快讯描述中,泛泛地提到了“技术研发、团队扩充及市场拓展”作为资金用途。由于缺乏公司官方更精细的说明,这十一个字的分配方向尚不可知。
但这恰恰是判断形界智维未来轨迹的核心。如果最大比例的支出流向算力采购和模型训练,它本质上仍是一家模型公司,平台故事可能只是融资的包装话语;模型公司的估值天花板通常受限于API调用单价和市场规模,且面临开源模型的直接冲击。反之,如果资金大规模用于开发者生态建设、行业解决方案团队搭建和API基础设施,平台承诺才有了落地的可能性,但这一路径的现金消耗速度更快,短期内很难看到正向流水。目前公司注册资本为100万元,在完成数千万级融资后,资本结构将发生变化,创始团队的股权被稀释程度以及新进投资方在战略决策中的话语权,也会左右公司走向。早期团队规模和技术产品化进度均未被披露,这些空白让外界难以评估其执行路径的清晰度和可行性。
那些只有形界智维自己才能回答的问题
形界智维的投资故事中,存在几个“待验证假设”,它们构成了这家公司商业前景的主要风险敞口。
第一,流式视频生成的技术护城河到底有多宽?Hugging Face日榜的成绩反映的是研究阶段的认可,但开源社区的特性意味着任何团队都可以快速复制和改进。Stream-R1和Stream-T1目前是否仍保持顶尖水平,公司后续是否有新的未公开技术储备,外部无从知晓。此外,如果护城河主要建立在精巧的工程实现和专有数据上,那么这些内容并未公开展示。
第二,实时生成的单位成本能否支撑规模化商业应用?在数字人直播、互动电商等场景中,视频生成是持续消耗算力的过程,如果单路视频的生成成本高于真人主播的收入或高于传统渲染方案,商业化就难以闭环。目前没有任何公开数据允许外界进行成本测算,也无法预估规模效应能带来多大的边际成本下降。
第三,客户的付费意愿验证为零。公司尚未披露任何付费客户、意向合同或合作案例。从技术到产品,再从产品到商品,每一步都面临着意料之外的摩擦。在互动视频这个尚处于萌芽期的市场,教育客户的成本可能比研发更高,尤其是需要内容创作者改变现有工作流程来适配新平台。
第四,团队的完整性和组织能力是未知数。当前公开信息中,形界智维几乎等同于“王裕鑫团队”,其他核心成员背景、团队分工、是否有产业界操盘经验的联合创始人,均未呈现。一个人的技术光芒可以点燃一家公司,但无法独自撑起一个平台。
第五,开源与商业化的平衡策略不明。Stream-R1和Stream-T1的开源为团队赢得了声誉,但framex-ai平台是否会继续开源核心模型?如果转向闭源,可能失去早期社区支持;如果保持开源,则可能加速竞争对手的追赶。这种两难选择将在公司商业化启动时变得尤为尖锐,而目前公司对此没有释放任何信号。
一个技术信号,但不是商业答案
形界智维的诞生,是AI视频生成从“美学竞赛”转向“实时竞赛”这一趋势的早期信号灯。流式视频生成确实指向了一个更具想象力的交互范式:视频不再是僵硬的文件,而是流淌的信息流,能够实时回应人类指令和环境变化。如果这一范式成立,它将重新定义视频内容的创作权、分发方式和消费体验,甚至可能催生全新的互动媒介形态。
然而,客观记录必须将信号与答案分开。形界智维目前拿出的,是一个技术方向的验证和一个团队背景的注脚。framex-ai平台的具体形态、流式生成的成本结构、第一批客户的验证结果、与竞争对手的性能对比,这些构成商业故事骨架的信息全部缺位。光源资本的天使赌注是基于对趋势和人的判断,但判断是否会兑现,取决于形界智维在接下来的一到两年里,能否把学术榜单上的排名,转化为真实场景中可以复购的产品。
在这个过程中,任何外部观察者都无权根据现有信息做出确定性预测。可以确认的只有一点:流式视频生成的赛跑已经发枪,而形界智维站在了起跑线上,仅此而已。
RecodeX 极客视:AI视频的下一程不在分辨率,而在刷新率。当所有人都挤在“画质”的独木桥上时,形界智维选择在“时间”维度上重新定义竞争。流式生成的本质不是让视频更清晰,而是让机器学会不和人类“离线对话”。但这一愿景的代价是,它必须同时攻克延迟、成本、理解和生态四道关卡,而这家公司手里的底牌,目前只有创始团队和两次Hugging Face日榜冠军。实时推理的世界,每一毫秒都算数,容错率远比离线生成低得多。记住,从Demo到现金流之间的距离,永远是一段未被测绘的沼泽地。