一场关于“抢话与呆滞”的行业僵局
在语音AI已经能完成订餐、客服、甚至心理咨询的2026年,一个更尴尬的事实正在浮出水面:当这些AI被装上一张脸,它们反而不会说话了。用户话说到一半,虚拟形象保持礼貌的静止;用户停下来等待回应,它却突然开口抢话;而当用户试图通过皱眉、移开视线或加快语速来表达不耐烦时,对面那张精心渲染的脸毫无反应。这不是某个产品的缺陷,而是当前数字人技术路线的结构性结果——语音识别、大语言模型、语音合成、面部动画系统被拼接成一条流水线,每一次交接都在丢失信息、累积延迟。
西雅图AI研究实验室Nuance Labs试图用一笔新融资正面回应这个问题。2026年9月14日,这家由三位前苹果博士研究员创立的公司宣布完成5000万美元A轮融资,由回归投资者Lightspeed Venture Partners领投,回归投资者Accel、South Park Commons与新投资者NVIDIA、Define Ventures参与。公司称,这笔资金将用于开发一个全双工音视频基础模型——不是把现有组件拼起来,而是让单一模型同时流式接收用户的视听信号、同时流式生成包含语音、面部表情和肢体语言的响应。
这笔融资的真正看点不在于金额。在基础模型公司动辄数亿美元融资的2026年,5000万美元的A轮更像一次精准押注。Lightspeed从种子轮跟到A轮并升级为领投方,NVIDIA作为新投资者入场,指向的是一个尚未被验证但逻辑清晰的技术判断:如果AI真的要以“人”的形态进入销售、教育、客服和陪伴场景,那么“面对面”的交互能力不能靠工程胶水粘合,而必须成为模型架构的一部分。
| 字段 | 内容 |
|---|---|
| 公司 | Nuance Labs |
| 轮次 | A轮 |
| 金额 | 5000万美元 |
| 投资方 | Lightspeed Venture Partners(领投,回归投资者)、Accel(回归投资者)、South Park Commons(回归投资者)、NVIDIA(新投资者)、Define Ventures(新投资者) |
| 总部 | 美国西雅图 |
| 创始人 | Fangchang Ma(马方畅,联合创始人兼CEO)、Edward Zhang(联合创始人兼CTO)、Karren Yang(联合创始人兼首席科学家) |
| 官网 | https://www.nuancelabs.ai |
从Apple Vision Pro的Digital Persona到“单一模型”的赌注
Nuance Labs的技术主张建立在一个明确的批判之上:现有虚拟形象系统由多个独立组件拼凑而成,语音识别将音频转为文本,语言模型生成回答,语音模型合成声音,动画系统驱动面部。公司称,每一次交接都会丢失信息并增加延迟,语调、犹豫、目光和手势可能根本无法到达语言模型,而虚拟形象在流水线完成响应之前往往保持静止。这个判断在技术逻辑上并不难理解:当“听”和“说”被拆成串行步骤,实时对话中最重要的时序信息——一个人什么时候停顿、什么时候加速、什么时候用表情示意“我在听”——就在格式转换中被丢弃了。
Nuance Labs的回应是架构层面的。据公司披露,其模型以全双工方式处理输入的音频和视频,同时生成音视频响应,使虚拟形象可以在人仍在说话时通过语言和非语言线索表明自己在跟随,而不是等待完整转录后轮流发言。公司称,模型从人们实际的对话行为中学习,实时响应能力内置于架构而非后置叠加。这与OpenAI等公司先生成文本再转换为视频的多步流程形成对比——后者是当前AI视频生成的主流路径,但Nuance Labs认为这种路径在面对面实时交互场景中天然受限。
创始团队的履历为这个技术路线提供了可信度背书。据Runtimewire报道,Fangchang Ma拥有MIT机器人学与机器学习博士学位,Edward Zhang拥有华盛顿大学计算机图形学博士学位,两人在进入South Park Commons的Founder Fellowship(2024年)之前,曾为Apple Vision Pro的Digital Persona系统做出贡献。Karren Yang同样拥有MIT博士学位,并在苹果从事音视频生成工作。这意味着三位创始人在苹果期间面对的核心问题——如何在远程呈现中忠实重建一个人——正是Nuance Labs试图解决的“面对面AI”问题的上游。但上游经验不等于下游能力:在苹果做研究组件与独立运营一家基础模型公司之间,隔着训练基础设施、数据策略、评估体系和商业化路径的完整鸿沟。
全双工架构的产业含义:不是更好的动画,而是不同的交互层
Nuance Labs的定位并非“更逼真的数字人”,而是“可被其他产品构建其上的交互层”。公司列举的潜在应用场景包括销售与客服、教练、职业培训和教育。这个场景列表的广度本身说明了公司的平台野心:它不想只做一个虚拟治疗师或AI导师,而是想成为任何需要面对面AI交互的产品的底层能力供应商。Lightspeed在其投资组合页面将Nuance Labs描述为“构建实时人类基础模型,为语音、面部和身体赋予社交与情感智能”,这与公司自身的平台定位一致。
但“交互层”这个定位在2026年的AI产业中并不新鲜。从语音API到情感计算模型,多家公司都在争夺“人与AI之间的最后一层”。Nuance Labs的差异化在于它把“看”和“说”合并进了同一个模型的同一时刻,而不是分别调用视觉模型和语音模型再同步结果。从已披露的技术描述看,这意味着模型需要同时处理视觉token和音频token的流式输入,并在生成端保持语音、面部表情和肢体语言的一致性。这是一个比单纯生成一段逼真视频更难的约束条件:生成的内容不仅要“像人”,还要在时序上与用户的实时行为对齐。
这里存在一个尚未被公开验证的技术张力。全双工意味着模型必须在用户仍在说话时就开始生成响应——包括非语言响应,如点头、眼神变化或面部微表情。但“开始生成”的时机本身就是一个判断:太早会被视为打断,太晚则回到“呆滞”。公司称模型从人们的实际对话行为中学习,但来源材料未披露训练数据的规模、构成或采集方式。从已披露的信息看,Nuance Labs尚未公开模型的具体技术指标,包括延迟、参数量或训练数据规模。这意味着“全双工”目前仍是一个架构描述,而非一个可被独立验证的性能承诺。
资本结构:老股东加码,NVIDIA的战略意味
这轮融资的资本结构值得拆解。Lightspeed从种子轮参投方升级为A轮领投方,Accel和South Park Commons继续跟投,NVIDIA和Define Ventures作为新投资者入场。据Runtimewire报道,Accel、Lightspeed和South Park Commons此前在2025年支持了Nuance Labs的1000万美元种子轮,使其公布融资总额达到6000万美元。NVIDIA和Define Ventures为新投资者。SEC文件显示,Nuance Labs在A轮公开宣布之前已售出约4670万美元证券,发行上限约6080万美元,首次出售日期为3月12日,Lightspeed合伙人Nnamdi Iregbulem被列为董事。
NVIDIA的入场在2026年的语境下带有明确的战略信号。作为AI训练和推理基础设施的核心供应商,NVIDIA对“下一代交互模型”的投资通常意味着对算力需求方向的前瞻性判断。全双工音视频模型的训练和推理成本显著高于纯文本模型,实时流式推理对GPU的吞吐和延迟要求也更为苛刻。NVIDIA作为投资者而非单纯的算力供应商出现,可能意味着Nuance Labs的模型架构与NVIDIA的推理栈之间存在某种协同空间。但来源材料未披露NVIDIA的投资金额、是否包含算力资源置换,或双方是否存在技术合作条款。Define Ventures是一家专注于医疗健康领域的风投机构,其入场暗示Nuance Labs的交互层在虚拟治疗师、患者沟通等医疗场景中可能被赋予期待,但公司官方材料未将医疗列为优先应用方向。
Lightspeed合伙人Nnamdi Iregbulem在投资声明中称:“创始团队拥有罕见的技术才能与运营卓越的结合,他们将其转化为一个能实时跟随你的单一模型。”这是投资方声明,而非独立验证的事实。从Lightspeed的投资组合页面看,该公司在2025年Nuance Labs成立当年即参与种子轮投资,并列出合伙人Guru Chahal和Nnamdi Iregbulem。种子轮进入、A轮领投的路径表明Lightspeed对团队的信任在加深,但这同样意味着该基金在这笔投资上的风险敞口在扩大——而模型尚未进入广泛公开使用。
资金用途:5000万美元将流向哪里
据公司披露,A轮资金指定用于模型开发、研究招聘和首次公开研究预览。Nuance Labs正在预训练基础设施、强化学习研究、模型优化、推理、数据基础设施和人类评估等方向招聘。这个招聘清单透露的信息比公司新闻稿中的愿景描述更具体:它说明Nuance Labs正在构建的是一个完整的专用基础模型训练与服务栈,而不是在现有语音API上叠加动画层的轻量级路线。
从已披露的团队规模变化看,Nuance Labs从种子轮宣布时的4人扩展至网站列出的20多名研究员、工程师与运营人员。这个扩张速度在AI研究实验室中属于克制型:20多人的团队要同时覆盖预训练、强化学习、推理优化和人类评估,意味着每个人都在承担多个职能。相比之下,头部基础模型公司的团队规模通常以百人计。Nuance Labs的“小团队、大模型”策略能否奏效,取决于其模型架构是否真的能在数据效率和训练成本上实现突破——而这一点尚未被公开验证。
自建专用基础模型的训练、服务与评估栈成本高昂,这是Nuance Labs商业模式中最大的结构性风险之一。公司定位为平台型基础模型供应商,未来计划通过API向开发者开放情感模型,用于虚拟治疗师、AI导师和互动游戏角色等场景。但来源材料未披露具名客户或收入数据。在没有任何付费客户验证的情况下,5000万美元的A轮更像是对技术路线和团队执行力的押注,而非对商业模式的验证。
竞争格局:Nuance Labs在与谁赛跑
来源材料未点名具体竞争对手。Nuance Labs的官方A轮新闻稿仅提及与“将转录、语言、语音和动画系统拼接在一起”的多组件流水线的区别,未直接对标任何公司。SegmentFault转载的Upstarts Media内容在种子轮时期曾将Nuance Labs与OpenAI等“先生成文本再转换为视频”的多步流程进行对比,但该对比来自第三方报道,未见于公司官方A轮材料。
从产业视角看,Nuance Labs面对的是三类竞争者。第一类是拥有全栈能力的巨头:OpenAI、Google和Meta都在推进多模态实时交互模型,它们拥有Nuance Labs无法匹敌的算力、数据和分发渠道。第二类是语音AI公司:从语音合成到实时语音对话,这些公司已经在客服、销售和陪伴场景中建立了客户关系,它们向视频和面部表达的扩展路径更为渐进。第三类是数字人/虚拟形象公司:它们拥有成熟的渲染和动画技术,正在向更智能的交互层演进。Nuance Labs的差异化在于“单一全双工模型”的架构选择,但这个差异化在巨头面前能否构成护城河,取决于其模型在实际对话中的表现是否显著优于“拼接式”方案——而这正是2026年晚些时候公开预览需要回答的问题。
一个值得注意的细节是,Nuance Labs的顾问Yaser Sheikh在计算机视觉和社交感知领域有深厚积累。来源材料未披露Sheikh在Nuance Labs的具体职责或投入程度,但他的存在暗示公司在学术资源和研究方向上的某种连接。从已披露的信息看,Nuance Labs的团队构成偏向研究导向,这与其“AI研究实验室”的自我定位一致,但也意味着从研究到产品的转化路径尚未被证明。
风险与待验证假设:公开预览是真正的考试
Nuance Labs的核心技术主张——单一音视频模型能否足够快速地响应实时对话,同时保持身份、表情与连贯语音——有待2026年晚些时候的公开预览验证。这是公司成立以来第一次将模型暴露在公众面前,也是投资逻辑中最大的未决变量。公司计划通过候补名单获取早期研究演示的访问权限,Ma在融资宣布中引导潜在合作者加入候补名单。但“研究预览”与“可商用产品”之间的距离仍然显著:预览可以容忍延迟、错误和有限场景,而商业部署需要稳定性和可扩展性。
从已披露的信息看,Nuance Labs尚未公布任何具名客户或收入数据。公司列举的销售与客服、教练、职业培训和教育等应用方向仍是“可能的应用”,而非已验证的需求。在AI基础模型领域,从“技术演示令人印象深刻”到“客户愿意付费”之间的鸿沟已经被多家公司反复证明。Nuance Labs的平台定位意味着它需要说服其他产品开发者将其交互层集成到自己的应用中,而开发者对“尚未公开预览的模型”的采用意愿天然有限。
另一个待验证的假设是“全双工”是否真的需要专用基础模型。批评者可以合理地质疑:现有的语音AI加动画系统是否通过更好的工程优化就能解决大部分“呆滞与抢话”问题?如果答案是肯定的,那么Nuance Labs自建专用模型的高成本路线就失去了经济性基础。从已披露的信息看,Nuance Labs尚未提供独立第三方验证来证明其单一模型方案在延迟、自然度和成本上显著优于优化后的多组件流水线。公司称其模型“实时响应能力内置于架构而非后置叠加”,但这是公司口径,未获独立验证。
从已披露的融资节奏看,Nuance Labs在2025年完成种子轮后不到一年即完成A轮,且SEC文件显示A轮的实际销售从3月就已开始。这个速度说明资本市场对“面对面AI”方向的兴趣在升温,但也可能意味着公司在模型尚未公开验证的情况下就完成了大额融资——这对创始团队的执行力提出了更高要求。如果2026年晚些时候的公开预览未能展示出与现有方案的可感知差异,后续融资和商业合作都将面临压力。
验证边界与可复核指标
本文涉及的“首个、唯一、最大、领先”、订单、出货、性能等表述,如无另行说明,均是公司、创始人或投资方在现有公开材料中的披露口径;RecodeX未在本次采集材料中找到独立审计或第三方测试结论,因而不将其视为已经独立确认的事实。文中的产业协同、竞争位置和商业路径属于基于已披露产品与融资用途的编辑分析,不代表相关结果已经实现。
- 技术侧应核验第三方测试条件、样本规模、良率、稳定性及与可比方案一致口径的结果;
- 商业侧应核验去重后的付费客户、可执行合同、收入确认、复购率以及订单转化;
- 资本与产业协同应以工商股权、关联交易、联合开发、采购或量产文件为准。
RecodeX 极客视:Nuance Labs的A轮融资是一场关于“AI是否需要一张会看人的脸”的押注。三位前苹果研究员把他们在Vision Pro Digital Persona项目中遇到的上游问题——如何让数字人真正跟随人类的非语言线索——变成了一个独立公司的核心命题。全双工音视频模型的架构选择在逻辑上自洽,但“单一模型优于拼接流水线”的判断尚未经过公开验证。5000万美元买到的是一张通往2026年公开预览的门票,而那张门票能否兑换成开发者生态和付费客户,取决于一个更朴素的问题:当人们面对一个会点头、会皱眉、会在你停顿时不抢话的AI时,他们是否真的愿意为这种“被理解的感觉”买单。在语音AI已经证明“能说”的2026年,Nuance Labs要证明的是“会听”——而“会听”恰恰是AI最难伪装的能力。
