几乎所有声音AI都在学习“说了什么”。Noise AI的路径却是让模型理解“怎么发生的”。
当主流音频模型将竞争焦点放在更自然的TTS、更低延迟的实时对话、更准确的语音转写时,这些系统其实只处理了声音中最容易被文字描述的一层。它们知道一段音频“代表”关门声,但无法判断门是什么材质、用了多大力、声源在多远处,以及房间的混响如何改变了声音的传播路径。也就是说,模型理解某个声学事件的“标签”,却不理解生成这个声音的物理条件。对于以语言为中心的AI来说,一句“我没事”的文字转录本身就有意义;但在物理世界中,同一句话从不同的人口中说出,传达的信息可能截然不同——可能是安慰,可能是逞强,也可能是冷漠。
深圳声音动力科技有限公司(Noise AI)正试图填补这个空白。这家成立于2025年的公司,在近日完成了数千万元种子轮融资,最新投资方为金沙江创投,此前北极光创投与英诺天使基金也参与了投资。与市场上绝大多数音频AI公司不同,Noise AI不打算继续卷入音乐生成、语音识别或TTS的红海竞争,而是希望构建一个“声音版的世界模型”——让AI理解声音的产生、传播、空间响应及感知全过程。
| 字段 | 内容 |
|---|---|
| 公司 | 深圳声音动力科技有限公司(Noise AI) |
| 轮次 | 种子轮 |
| 金额 | 数千万元 |
| 投资方 | 金沙江创投 |
| 历史投资方 | 北极光创投、英诺天使基金 |
| 总部 | 未确认(公司注册地为深圳,另有来源称北京) |
| 创始人 | 陈伟嘉 |
| 官网 | https://noiz.ai |
| 成立时间 | 2025年9月(投资界),另有来源称2024年(未核实) |
| 产品 | 自研开源音频模型底座AudioX,创作者音频产品Noise AI,API与企业集成服务,3D与具身智能空间声场解决方案 |
| 用户规模 | 全球约200万海外创作者 |
| 营收状况 | ARR达百万美元(来源未确认是否仅来自企业API) |
| 团队规模 | 正职员工10余人 |
一个连续创业者的“教训”如何催生出声音物理模型
创始人陈伟嘉的履历在音频AI创业者中显得特殊。他曾在Meta和TikTok从事视频、ASR与Agent相关工作,回国后创办身份管理SaaS公司玉符科技,2020年被腾讯收购。此后他在腾讯参与了Agent模型的工程化落地、语音克隆、多模态模型等多个技术阶段,同时也是语音克隆开源项目Mockingbird的作者。
但真正塑造Noise AI产品逻辑的,是他第一次创业的商业化“教训”。玉符科技在研发身份认证SaaS时,团队埋头打磨技术,产品问世近20个月才尝试商业化,结果市场反馈远低于预期。最终依靠2020年疫情背景下腾讯会议用户规模的大幅跃升,公司被腾讯收购,才意外获得了一个商业出口。“以市场反馈指引技术”从此在陈伟嘉的决策逻辑中扎根。这一经验被直接复制到Noise AI:公司创立初期即自研开源音频模型底座AudioX,并同步推出面向创作者的音频产品Noise AI进入市场,接受付费验证。用他自己的话说,C端用户并非主要现金来源,而是作为模型初期迭代的“数据雷达”。这一策略意味着Noise AI的产品化与模型训练几乎同步开始,而非先完成技术研发再寻找商业场景——这与许多从实验室孵化的AI项目存在路径差异。
陈伟嘉在2022年就感受到仅靠文本转语音无法还原人说话时的真实状态。“跳出语言,一个咳嗽声、非语言的声音、重重关门的声音,本身还有很多信息量。甚至,这些信息量代表着事件发生了,会有什么后续。”他在接受36氪旗下智能涌现采访时说。过去的声音AI完全没有捕捉到这些,声音需要连接到环境上下文,而非文本上下文。这一判断构成了Noise AI整个技术路线的基本前提:声音不仅是语言的载体,更是物理事件的证据。
“跟文本走得越近越卷”:Noise AI的技术底座与数据壁垒
Noise AI的技术主张建立在当前音频模型共同的盲区之上:互联网上有大量音频数据,但极少有数据会系统标注声音背后的物理条件。一声关门的录音通常不会同时标注房间的大小和结构、门的材质和厚度、声源与麦克风的距离、空间中的混响和反射、施加在门上的力度,以及听者所在的位置和方向——而正是这些变量,构成了声学智能所需要的训练基础。当前行业普遍的做法是依赖互联网音频,再通过文本标签或多模态模型补充事件描述,但这类数据本质上只告诉模型“发生了什么”,而非“为什么这样发生”。模型因此能够复现一段听起来合理的声音,却很难判断在一个全新空间里,声音是如何产生和传播的。
陈伟嘉对此的总结直白得近乎残酷:“跟文本走得越近越卷,反之则越蓝海。”在Noise AI提出的声学智能框架下,语音并非声音智能的全部,而只是其中一个特例。当模型真正理解声音如何发生时,情绪、空间感和距离感就不需要作为后期效果附加上去,而可以成为同一个生成和理解过程中的内生变量。这也是其与传统TTS、素材型音效生成以及以对话为中心的Audio Language Model之间最主要的区分。传统手段往往先生成声音内容,再通过后处理添加空间感和情绪色彩,而Noise AI的逻辑是将这些变量嵌入到生成过程的源头——这意味着模型需要学习的是物理规则本身,而非仅仅模仿音频片段。
为了构建核心壁垒,Noise AI搭建了三层数据来源。第一层是真实世界采集:通过专门设计的流程控制空间、材质、距离、方向和事件,获得未经重度后期加工的高保真声音。据智能涌现报道,来自“杜比声”的数据采集成员会用空间音频方法,在录制时使用两个或四个麦克风,处理声道同步、设备位置统一和空间信息。第二层是物理声学仿真:批量生成现实中难以穷举的材质、空间和声源组合,以扩大训练条件的覆盖范围。第三层来自产品端:创作者在noiz.ai中的生成、重试、编辑、保留、导出和付费行为,会被转化为偏好信号,帮助模型判断哪些声音更匹配画面、哪些情绪更有表现力。真实采集保证真实性,仿真补足规模,用户行为提供审美反馈,三者共同形成数据闭环。这种闭环设计的隐含假设是:用户的审美选择实际上提供了对“物理准确性”的一种弱标注——创作者倾向于选择那些在特定画面或场景中听起来更自然、更有说服力的声音,这些偏好信号可能逐步引导模型向更符合物理直觉的方向迭代。
200万创作者、百万美元ARR与三层商业验证
Noise AI目前的商业布局呈现出清晰的三层结构。最外层是面向创作者的音频产品Noise AI,聚焦短视频、内容制作和泛娱乐场景,提供语音、音乐、音效、视频配音和声音编辑能力。这部分已积累约200万海外创作者,根据投资界报道,公司ARR已达到百万美元。但陈伟嘉明确将C端产品定位为模型的“数据雷达”而非核心收入来源,这意味着C端用户的使用行为——包括生成、重试、保留和付费——更多是作为模型训练的信号,而非直接的营收引擎。
中间层是API与企业集成服务。同一套模型以API和系统集成的形式进入内容平台、视频生产工具和企业工作流。企业客户可以根据业务需求调用语音、音乐、音视频、翻译和空间音频等不同能力,主要客户来自短剧、游戏、视频生产等领域。这一层是当前商业变现的主路径。从商业模式逻辑看,API服务可能比C端订阅具备更高的收入稳定性,因为企业客户的调用需求往往与自身业务量挂钩,且迁移成本较高。但值得注意的是,Noise AI目前尚未披露具体的企业客户名称和合作案例细节,投资者对于这一层业务的客户集中度和续费率尚无公开信息可供评估。
最内层——也是最能体现公司长期野心的部分——是3D与具身智能合作。与传统的“给画面后期贴上一段音效”不同,Noise AI对于3D场景的目标在于根据几何结构、材质、距离和听者位置,生成匹配的空间声场。今年6月,团队发布AudioX-Turbo进一步解决生成速度问题。在团队看来,在无声视频生成声音的场景中,模型需要让脚步、碰撞、运动和画面中的事件尽可能同步发生,而非等待长时间离线渲染。这一模型是将公司从离线内容制作推向交互式声学系统的基础。团队认为,“当声音能够足够快地生成,才有机会进入实时视频、游戏、虚拟角色和人机交互系统。”
对于机器人而言,听觉具有全向、连续和不受视线遮挡的特征。陈伟嘉将具身智能领域的应用机会概括为“给机器人戴上耳朵”——机器人可能通过声音更早感知身后的脚步、周围的碰撞、设备内部异常摩擦、一次动作是否产生了合理的物理结果。目前Noise AI已与一家具身智能公司合作,以技术咨询和模型适配的方式提供模型,帮助识别空间声音事件。据陈伟嘉介绍,合作方的机器人已能通过声音判断身后或旁边有杯子掉落并主动处理。这一合作目前仍处于早期阶段,尚未形成标准化产品交付,这意味着具身智能方向仍处于技术验证期,距离规模化商业收入尚有距离。
为什么金沙江创投选在这个时间点押注?
这笔融资的时机选择具有明显的信号意义。当前音频AI领域资本密集涌入的方向几乎全部集中在语音交互和音乐生成赛道,Noise AI是少数公开获得机构投资且明确拒绝参与该赛道内卷的公司。在投资机构普遍追逐“与大语言模型能力对齐”的音频应用的背景下,金沙江创投选择一家从物理底层重新定义音频模型的公司,可能反映了其对音频AI赛道同质化竞争的警惕,以及对差异化技术路线的偏好。
团队配置是投资逻辑的重要支撑。除陈伟嘉外,联合创始人陈前具有北大、清华和MIT教育背景,此前曾任百川智能用户增长及运营负责人。首席科学家Zeyue Tian是最早系统研究音视频联合生成的研究员之一,其开源的全曲生成模型ChatMusician曾被杨立昆转发。团队其他成员来自Meta、Dolby、TikTok等公司和实验室,覆盖声音模型、多模态预训练、空间音频、产品工程和商业增长等方向。一个容易被忽视但值得关注的细节是:团队成员大多同时是兼职乐队乐手及音乐创作者——这意味着团队对声音的理解同时具备工程与审美的双重维度。这种跨界背景在一个需要同时处理物理声学和人类听觉偏好的领域中,可能构成一种难以被纯工程技术团队复制的隐性优势。
从资本结构看,种子轮即引入三家机构——金沙江创投、北极光创投、英诺天使基金——对于一家团队仅10余人的公司而言并不算轻。这通常意味着投资人对技术路线方向给予明确背书,同时也对团队提出了较高的验证速度要求。目前Noise AI的团队规模(“正职员工10余人”)与同时推进的三条业务线之间,已然存在资源配置上的压力。C端产品迭代、企业API服务、开源社区维护以及具身智能合作项目均需要人力投入,如何在不稀释技术深度的前提下完成多线并行,是团队在下一阶段必须直面的管理挑战。
资金将投向何处:模型统一、速度提升与实时交互体系的搭建
本轮融资的官方表述资金用途为“技术研发、产品迭代及团队扩充”。但从公司现有技术路线图来看,这笔钱需要支撑至少三个并行目标。
第一个是底层模型的进一步统一。公司正在推进的下一代模型,目标是让声音随着环境变化而变化:当门被打开或关闭、物体从木材变成金属、听者从房间走到走廊、声源从正前方移动到身后、空间由铺设地毯的卧室变成空旷的地下车库时,声音表现可以根据新的空间、材质、位置和事件状态实时产生变化。这意味着模型要从“生成一段看起来合理的声音”进一步走向“在当前条件下推演此刻应该听见什么”——从复现既有数据分布的generator变成能够根据物理变量推演声音的simulator。这一转变本质上要求模型内部建立一套可泛化的物理声学表征,而非对训练数据中的音频模式进行统计性重组。
第二个是生成速度的持续优化。AudioX-Turbo已经在这一方向迈出了一步,但距离真正的实时交互——用户在互动游戏中每做一个动作,系统都要根据场景、材质、距离和方向实时生成声音——仍有差距。在实时交互内容平台中,只要用户在线,平台就需要持续调用API,这意味着调用频率和收入上限都比离线制作场景高出一个量级,但对模型延迟的要求也同样严苛。从商业角度看,如果生成速度能够突破实时门槛,Noise AI的API业务可能从“内容制作工具”升级为“交互基础设施”,其商业模式也将从按次调用收费转向按使用时长或并发量收费,收入天花板可能显著提升。
第三个是团队扩张。10余人的团队要同时维护开源社区(AudioX)、C端产品迭代、企业API服务以及具身智能合作项目,人力分配将是一个现实挑战。公司在技术研发、产品工程、商业增长等方向的招聘节奏,将直接影响各条业务线能否按期达到验证目标。尤其是在具身智能方向,公司目前以技术咨询和模型适配的方式参与合作,这种模式对团队的技术输出能力要求较高,如果团队规模无法匹配合作需求的增长,可能导致合作深度受限或交付周期拉长。
待验证的假设:从“听起来合理”到“物理上准确”的最后一公里
Noise AI提出了一个技术上引人注目且逻辑自洽的叙事,但这个叙事在商业化路径上同时面临着几个待验证的假设,而公开材料尚未给出明确答案。
首先是技术可验证性问题。公司声称采集了包含空间、材质、距离和方向信息的训练数据,并构建了物理声学仿真与用户反馈的数据闭环。但对于外部评价而言,目前没有一个被行业广泛接受的基准来评估模型对“物理世界声学规则”的理解程度。TTS和语音识别领域有WER(词错率)、MOS(平均意见分)等成熟指标,但“关门声的材质和力度是否准确”这类维度缺乏标准化测试集。这意味着Noise AI在短期内需要依靠具体应用场景中用户的主观体验来证明其技术路线的优越性,而这一类优势往往难以在商业竞标中形成可量化的绝对壁垒。如果竞争对手以“足够好”的声音质量提供更低价格或更快交付的产品,Noise AI在物理准确性上的投入可能难以直接转化为商业竞争力,除非其目标客户——例如3A级互动游戏或高精度工业仿真——对声学准确性有刚性需求。
其次是市场节奏的匹配问题。陈伟嘉瞄准的实时交互内容平台(互动游戏、虚拟世界)和具身智能市场,目前都处于相对早期的阶段。互动游戏和虚拟世界的爆发时点尚不明确,而具身智能行业整体仍处在硬件能力和基础智能的突破期,听觉感知在大规模商业化优先级排序中通常排在视觉、触觉和运动控制之后。公司目前仅有一家具身智能合作方,且合作模式为“技术咨询和模型适配”,这意味着距离标准化的商业产品交付还有一段路要走。如果下游市场的爆发周期长于预期,Noise AI需要依靠企业API业务维持收入增长并在资本市场持续获取融资,而C端的200万用户数据闭环在多大程度上能独立支撑模型迭代效率,也是一个开放问题——用户行为数据可以提供审美偏好信号,但可能不足以替代对物理变量进行系统性标注的专业数据。
此外,从行业竞争格局来看,Noise AI当前在“声音物理世界理解”这一细分方向上没有明确的直接竞品——这既是先发优势,也意味着教育市场的成本需要由自己承担。当一家公司在创造一个新品类时,它不仅要打磨产品,还要向潜在客户解释为什么“理解声音的物理过程”是必要的,而非“听起来够好就行”。更值得警惕的是,主流音频模型公司在语音和音乐生成赛道饱和后,完全有可能凭借已有的数据规模和工程能力向空间音频和物理声学方向迁移。届时Noise AI的先发数据壁垒能否抵挡住大厂的资源碾压,取决于其数据飞轮是否已经转得足够快——具体而言,其三次数据来源的闭环是否已经积累出足够的规模和独特性,使得后来者即便拥有更多算力和工程人才,也难以在短期内复现同等质量的物理声学训练数据集。
最后,Noise AI还需要回答一个更根本的问题:在商业化早期,物理准确性到底是不是一个足够大的卖点?对于一部分内容创作者和企业客户而言,当前市场上基于素材拼接或统计生成的音效方案可能已经“足够好”,而Noise AI提供的物理级模拟所带来的体验提升,可能只有在高度沉浸式的场景——如VR、3A游戏、专业影视制作——中才能被充分感知。这意味着公司需要精准地找到那些对声学真实性有刚需且愿意为之付费的早期标杆客户,通过它们验证产品价值和建立行业口碑,而非在泛化的内容创作市场中进行价格竞争。
RecodeX 极客视:Noise AI正在做一件音频AI领域很少有人在做的事:放弃文本的近道,转而直面声音发生的物理过程。从开门声的材质和力度,到机器人背后的杯子落地——这些信号在当前的AI系统中几乎被系统性忽略。陈伟嘉用“跟文本越近越卷”来概括红海困境,但他的解法本身也在走一条更艰难的路:需要自建数据采集体系、在多个下游市场同时验证、并等待实时交互和具身智能这两个尚未完全爆发的场景成熟。种子轮三家机构的背书提供了起跑的资本,但真正棘手的问题还在后面:物理声学模型的评估标准怎么建立?10余人团队如何在三条战线上保持聚焦?当主流玩家从语音赛道的疲惫中抬头转向时,Noise AI的数据飞轮是否已经转得足够快?与许多AI创业公司不同,Noise AI的护城河不在于模型参数规模或算力资源,而在于一套需要时间和流程才能积累的物理声学数据集——这个壁垒的建立速度,将决定它能否在先发窗口期内跑出足够的安全距离。
信息来源
本文在采集与核验阶段引用了以下公开来源,按站点去重列出;来源内容归原发布方所有,其口径不代表 RecodeX 的核实结论。
