原创报道
2026.09.15 00:33 约 14 分钟 AI人工智能 新发布

Nuance 获5000万美元A轮:前苹果研究员能否用单模型音视频交互解决AI虚拟人的延迟与不自然?

项目速览
项目名称 Nuance
融资轮次 A轮
融资金额 5000万美元
投资方 Lightspeed Venture Partners, Accel, Nvidia's NVentures, South Park Commons, Define Ventures

当一个人对着屏幕里的 AI 面试官回答“你最大的缺点是什么”时,对面那张脸在聆听的间隙偶尔点头、眨眼,但嘴角的弧度与眼神的落点却和问题内容毫无关系。这种微妙的不协调,正是当前语音助手和虚拟人产品难以跨越的体验断层。市面上的多数方案把语音转文字、大语言模型生成回复、文字转语音三个环节串成流水线,每一段都带来毫秒级延迟,叠加之后变成人机对话中无法忽视的停顿;更关键的是,这套架构天然丢失了人类交流中即时反应、微表情和情绪线索。

西雅图 AI 初创公司 Nuance 试图从底层架构上绕开这条流水线。公司联合创始人兼 CEO Fangchang Ma 对 Business Insider 表示,现有 AI 虚拟人“在听的时候没有反应,或者只是在做随机的事情”。Nuance 给出的答案是:用一个模型直接处理音视频输入和输出,不再拼接三个独立系统。这一技术路线刚刚获得资本市场的重注——公司宣布完成 5000 万美元 A 轮融资,由 Lightspeed Venture Partners 领投,Accel、英伟达旗下 NVentures、South Park Commons 和 Define Ventures 参投。

这轮融资让一家尚无产品、团队仅 8 人的公司进入多模态 AI 竞赛的显眼位置。Nuance 成立于 2025 年,由三位前苹果研究员联合创立,其中只有 Fangchang Ma 一人公开姓名,另外两位联合创始人未披露。公司总部位于西雅图,官网未披露。去年 7 月,Nuance 完成由 Accel 领投的 1000 万美元种子轮融资;时隔一年多,A 轮金额达到种子轮的五倍。

字段 内容
公司 Nuance
轮次 A 轮
金额 5000 万美元
投资方 Lightspeed Venture Partners(领投)、Accel、Nvidia’s NVentures、South Park Commons、Define Ventures
总部 西雅图
创始人 Fangchang Ma 及两名未具名前苹果研究员
官网 https://dragon.nuance.com/en-us/home

单模型音视频进出是对三段式架构的直接否定

Nuance 的技术主张建立在对现有 AI 语音助手架构的批判之上。据公司披露,当前多数 AI 虚拟人由语音转文字、大语言模型、文字转语音三个模块拼接而成。Fangchang Ma 称,这种拼接导致大量延迟,并丢失人类交流中的细微反应和微表情。Nuance 提出的替代方案是“一个系统、一个模型”,实现音频视频输入、音频视频输出。这一表述来自创始人访谈,属于公司口径;目前尚无独立第三方对其模型性能、延迟指标或情绪理解能力进行验证。

从技术逻辑看,单模型架构如果成立,确实可能减少模块间传递带来的延迟,并在训练过程中保留音视频信号之间的关联。三段式架构的问题不只是延迟叠加:语音转文字环节会把语调、停顿、重音和情绪色彩压平成文本,大语言模型只能基于被压平的语义生成回复,文字转语音再重新合成一套与原始输入脱节的韵律。这意味着即使每个模块单独优化到极致,信息在第一次转换时就已经丢失。Nuance 的单模型路线试图从训练阶段就保留音视频信号之间的原始关联,让模型学习“听到什么”和“看到什么”如何共同驱动“说什么”和“怎么表现”。

但这一路线的代价同样明显:模型需要同时学习语音、语义、面部表情、肢体动作和音画同步,训练难度远高于纯文本或纯语音模型。音视频信号的维度远高于文本 token,序列长度和计算开销都可能呈数量级上升。模型不仅要生成语义正确的回复,还要生成与语义匹配的面部动作、与语音节奏对齐的唇形变化,以及在聆听阶段做出恰当的微反应。这些能力在传统架构中由不同模块分别处理,单模型方案则要求一个网络同时掌握全部技能。Nuance 目前处于产品开发阶段,计划今年晚些时候公开研究预览版,这意味着外界还无法判断其单模型方案在实际交互中的表现。

训练数据是另一个结构性约束。Fangchang Ma 表示,Nuance 所需的数据无法从互联网抓取,公司通过内部采集或数据合作伙伴获取真实视听数据。他描述的理想数据形态是:两个人面对面交谈,双方都可见,音轨干净分离,且对话自然、非表演性。这种数据在规模、隐私和标注成本上都远高于文本语料。互联网上可以轻易获取大量文本和图像,但面对面对话的双向音视频记录几乎不存在于公开网络中。即使存在,也往往只有单侧视角、背景噪声混杂、音轨不可分离,或者本身就是表演性内容。公司未披露已获取的数据量、数据合作伙伴名单或数据采集进度,因此其训练数据储备是否足以支撑一个可用的基础模型,仍属未验证假设。

把 AI 面试官和销售代表作为商业化切口,但定价策略尚未成形

Nuance 计划向企业销售其模型能力,用例包括 AI 面试官、销售代表和客户支持。Fangchang Ma 同时提到面向个人用户的场景,例如通过视频通话与 AI 练习面试、演讲或学习语言。公司未披露任何客户名单或付费试点项目。

从场景逻辑看,AI 面试官和销售代表对交互自然度的要求确实高于普通客服机器人。面试场景中,候选人会敏锐地感知面试官的反应——一个不合时宜的点头、一次延迟过长的停顿,都可能影响候选人的表现和体验。销售场景则涉及说服、共情和实时应对,对微表情和情绪线索的依赖更强。Nuance 选择这些场景作为商业化切口,可能是看中了它们对“情绪智能”的付费意愿高于一般对话场景。但这一判断仍需验证:企业客户在采购 AI 面试官时,关心的可能不仅是交互自然度,还包括评估一致性、合规风险、候选人接受度和成本控制。这些维度在 Nuance 目前披露的信息中均未涉及。

值得关注的是,Nuance 的定价和货币化策略尚未确定。公司明确表示,下一步将招聘 go-to-market 专家来敲定这一策略。这意味着本轮融资进入时,Nuance 的商业化路径仍停留在用例假设层面。AI 面试官和销售代表属于企业服务中决策链条较长、对交互自然度要求较高的场景,企业客户通常需要看到明确的投资回报率数据才会采购。Nuance 目前没有可展示的产品,也没有可验证的客户反馈,从研究预览版到企业付费之间还有相当长的距离。

从资本结构看,本轮投资方组合透露出生态卡位的意图。英伟达旗下 NVentures 的参投尤其值得注意。NVentures 是英伟达的风险投资部门,其投资通常带有生态布局属性。对于一家需要大量算力训练音视频模型的初创公司,英伟达的资本进入可能在 GPU 资源、模型优化工具链和产业合作上提供便利。但 Nuance 和英伟达均未披露除股权出资外的任何商业合作条款,因此这一推断仅基于投资方身份,而非已确认事实。Lightspeed 和 Accel 的参与则延续了双方在 AI 基础模型和开发者工具领域的布局惯性,但同样没有公开信息表明除资金外的具体支持方式。

与 WaveForms AI 的路线差异:情感线索的两种实现方式

Nuance 并非唯一瞄准情感智能和实时音视频交互的创业公司。WaveForms AI 由前 OpenAI 研究员带队,获得 a16z 押注,同样聚焦情感线索。两者都试图解决现有 AI 语音助手“能说话但不会交流”的问题,但技术路线和团队背景存在差异。

Nuance 的核心主张是架构层面的统一:用一个模型替代三段式拼接,从底层保留音视频信号的完整性。WaveForms AI 的具体技术细节在现有材料中未披露,无法进行逐项对比。但从公开信息看,两者都处于早期阶段,都尚未证明产品化能力。Nuance 的差异化叙事建立在“单模型”这一技术选择上,而这一选择能否转化为可感知的用户体验优势,需要等到研究预览版发布后才能初步判断。

另一个竞争维度来自大型模型厂商。OpenAI、Google 和 Meta 都在推进多模态模型的实时交互能力,这些公司拥有远超初创企业的算力、数据和分发渠道。大厂的多模态模型已经在语音对话、视频理解和生成方面展示了快速迭代能力,它们进入实时音视频交互领域只是时间问题。Nuance 的生存空间取决于其能否在特定场景中做到比大厂更低的延迟、更自然的微表情同步,或者更深入的企业工作流集成。目前公司未披露任何性能基准或与大厂模型的对比数据,因此这一差异化优势仍停留在理论层面。

从团队背景看,Nuance 的三位创始人来自苹果,WaveForms AI 的团队来自 OpenAI。苹果在端侧计算、硬件协同和隐私保护方面有深厚积累,OpenAI 则在通用模型能力和 API 生态上占据优势。这种背景差异可能影响两家公司在技术选型和产品化路径上的偏好,但创始人的前雇主背景并不能直接推导出产品竞争力。Nuance 的苹果背景是否意味着其在实时系统、端侧推理或音视频同步方面有独特积累,目前没有公开证据支持。

八人团队与五千万美元之间的张力

Nuance 用 8 人团队支撑 5000 万美元 A 轮融资,这一比例在 AI 基础模型创业公司中并不常见。Fangchang Ma 表示,公司一直在用现金流扩充团队,本轮融资将主要用于研发团队扩张,并招聘市场和商业化人才。从资金用途看,Nuance 把研发放在首位,商业化人才排在第二步,这与公司 pre-product 的阶段一致。

但 8 人团队也构成现实约束。训练一个音视频多模态基础模型需要数据采集与清洗、模型架构设计、算力调度、评估体系搭建和产品化工程,每一项都是人力密集型工作。即便本轮融资提供了充足的资金,团队扩张本身也需要时间,而研究预览版的发布时间窗口已经设定在今年晚些时候。从已披露信息看,Nuance 尚未公布模型参数量、训练算力规模或评估基准,外界无法判断其研发进度是否与时间表匹配。

一个更具体的约束在于:音视频模型的评估体系本身就比文本模型复杂得多。文本模型可以用困惑度、基准测试分数和人类偏好对比来评估,音视频模型的“自然度”却涉及唇形同步、微表情时机、情绪一致性和对话节奏等多个维度,这些维度目前缺乏公认的量化标准。Nuance 如果要在研究预览版中展示可感知的体验优势,需要先建立一套内部评估体系,再让外部用户验证。8 人团队在数据采集、模型训练和评估体系之间如何分配精力,公司未披露。

创始团队的三位成员均来自苹果,但只有 Fangchang Ma 的姓名和 CEO 身份被公开。另外两位联合创始人的姓名、在苹果的具体职责、研究方向均未披露。这种信息不透明在早期创业公司中并不罕见,但对于一家以技术路线为核心卖点的公司,创始团队的技术背景是投资人之外的重要信任凭证。Nuance 选择不公开这些信息,可能出于竞业限制、个人隐私或竞争策略考虑,但也让外部评估者难以判断团队在音视频模型、情感计算和实时系统方面的具体积累。Fangchang Ma 在苹果期间的具体项目经历同样未披露,外界只能从公司技术主张反推团队可能的能力边界。

数据获取是比模型架构更深的护城河,也是更大的瓶颈

Nuance 对训练数据的描述揭示了一个行业级难题:互联网上充斥着文本和图像,但高质量的面对面对话音视频数据极度稀缺。Fangchang Ma 所说的“双方可见、音轨干净分离、自然非表演性”数据,在现实中几乎只能通过专门采集获得。这意味着 Nuance 需要自建数据采集流程,或者依赖数据合作伙伴。

自建采集的挑战在于规模和一致性。要让模型学会跨语言、跨文化、跨场景的自然交流,需要覆盖不同年龄、性别、口音、情绪状态和对话情境的数据。每一段数据都涉及参与者知情同意、隐私保护和数据清洗。面对面对话数据还涉及双人同步录制、设备布设、光照控制和音轨分离等技术环节,单段数据的采集成本远高于文本标注。数据合作伙伴模式可以加速积累,但会带来数据权属、排他性和质量控制问题。如果多家公司从同一数据合作伙伴获取类似数据,数据层面的差异化就会被稀释。Nuance 未披露其数据合作伙伴的身份、合作模式或数据规模,因此其数据护城河目前只是一个方向性判断,而非已验证事实。

从已披露的融资节奏看,Nuance 在种子轮后一年内完成 A 轮,且吸引了 Lightspeed、Accel 和 NVentures 这类机构,说明投资人对团队背景和技术方向有较高认可。但投资人判断与公司说法需要区分:投资人的认可反映的是对市场机会和团队执行力的预期,并不等同于对产品性能或商业化的验证。Nuance 目前没有产品、没有客户、没有定价策略,所有关于“无延迟、自然对话”的描述都来自公司口径。5000 万美元的 A 轮金额在早期 AI 公司中属于较高水平,但金额本身不能替代产品验证。

研究预览版是第一个可证伪的节点

Nuance 承诺今年晚些时候向公众开放研究预览版。这将是公司成立以来第一个可被外部检验的里程碑。研究预览版通常不等同于商用产品,但它至少能回答几个关键问题:单模型架构是否真的能实现音视频同步输出;延迟是否显著低于三段式方案;模型在真实对话中的微表情和反应是否自然;以及数据采集策略是否产出了足够质量的训练结果。

如果研究预览版延迟或体验不佳,Nuance 的“单模型优于拼接式”叙事将面临直接挑战。如果预览版表现超出预期,公司仍需解决从研究预览到企业付费的转化问题。企业客户关心的不仅是交互自然度,还包括稳定性、可扩展性、合规性和成本。Nuance 目前在这些维度上没有任何公开信息。研究预览版的开放方式也值得关注:是限时演示、排队申请还是开放 API,不同的开放方式会影响外部评估的深度和广度。公司未披露预览版的具体形式。

另一个待验证假设是团队扩张速度。Nuance 计划招聘研发和商业化人才,但西雅图 AI 人才市场竞争激烈,微软、亚马逊和众多 AI 初创公司都在争夺同类人才。8 人团队能否在研究预览版发布前扩张到足以支撑产品化的规模,公司未披露具体招聘计划或时间表。音视频多模态方向的人才池本身比通用 NLP 或 CV 更窄,找到同时具备语音、视觉和系统工程能力的研发人员可能需要更长的招聘周期。

从资本效率看,5000 万美元 A 轮融资为 Nuance 提供了较长的跑道。假设公司维持精简团队,这笔资金足以支撑数年的研发投入。但 AI 基础模型训练的成本曲线陡峭,音视频数据的采集和标注成本远高于文本,实际烧钱速度取决于公司选择的数据策略和算力规模。公司未披露资金消耗率或预期跑道长度。如果数据采集采用自建模式,固定成本会显著上升;如果依赖合作伙伴,边际成本可能下降但数据控制力减弱。这两种策略对资金消耗的影响截然不同,而 Nuance 尚未公开其选择。

Nuance 的故事核心是一个技术判断:人类交流中的情绪和微表情无法通过拼接式架构还原,必须从模型底层统一处理音视频信号。这个判断在逻辑上自洽,也符合多模态 AI 的长期演进方向。但从判断到产品,从产品到付费,中间隔着数据、算力、团队和商业化四重关卡。5000 万美元 A 轮融资买到的是一张入场券,而不是通行证。

验证边界与可复核指标

本文涉及的“首个、唯一、最大、领先”、订单、出货、性能等表述,如无另行说明,均是公司、创始人或投资方在现有公开材料中的披露口径;RecodeX未在本次采集材料中找到独立审计或第三方测试结论,因而不将其视为已经独立确认的事实。文中的产业协同、竞争位置和商业路径属于基于已披露产品与融资用途的编辑分析,不代表相关结果已经实现。

  • 技术侧应核验第三方测试条件、样本规模、良率、稳定性及与可比方案一致口径的结果;
  • 商业侧应核验去重后的付费客户、可执行合同、收入确认、复购率以及订单转化;
  • 资本与产业协同应以工商股权、关联交易、联合开发、采购或量产文件为准。

RecodeX 极客视:当 AI 虚拟人的破绽从“说话像机器人”缩小到“聆听时眼神不对”,竞争焦点已经从文本智能转向了人类交流中最难量化的部分——微表情、即时反应和情绪同步。Nuance 的单模型路线是对三段式架构的一次彻底否定,但否定旧方案不等于证明新方案可行。在 8 人团队、零产品、零客户、定价未定的现实面前,这 5000 万美元押注的其实是一个尚未被验证的假设:情感智能能否被建模,而不是被拼接。研究预览版发布那天,这个假设将第一次面对真实世界的检验。

RECODEX PARTNERSHIP
你的项目,下一篇值得报道
RecodeX 为 AI×Web3 早期项目提供从深度报道到融资撮合的全链路服务。三档方案,按阶段匹配。