短视频与短剧的产能正在以小时为单位膨胀,但音频仍然是一道需要手工缝合的工序。创作者可以在几分钟内用AI生成画面、剪辑出节奏紧凑的片段,却往往要花同样甚至更长的时间去挑选背景音乐、对齐音效、调整情绪节点。更棘手的是,画面来自AI、音频来自素材库,两者之间没有真正的时序关系。一个动作快半拍、一个重音慢半拍,观感就会从“专业”滑向“粗糙”。
这正是Sonilo试图切入的位置。这家总部位于旧金山的生成式音频初创公司,由TikTok人工智能与音乐部门的成员创办,正在开发可根据屏幕画面自动生成配乐与音效的模型。2026年10月8日,据Variety独家报道,Sonilo完成1100万美元融资,由B Capital领投,Redpoint参与。公司称,这笔资金将用于支付扩展模型所需的算力,并扩大在创作者与开发者平台中的覆盖,同时建设音乐授权业务。
与多数先把音频生成做成“文字到音乐”工具的公司不同,Sonilo把视频理解放在系统前端。其核心产品名为Sound World Model,公司称这是一个将视频理解与音频生成及时序绑定的多模态系统。用户上传片段后,系统读取画面运动与情绪变化,再生成针对该素材的音频;用户也可以输入文字描述,或将视频与文字结合。这个技术路径的差异,决定了它进入的不是泛化的AI音乐赛道,而是AI视频工作流中一个尚未被标准化的环节。
| 字段 | 内容 |
|---|---|
| 公司 | Sonilo |
| 轮次 | 未披露 |
| 金额 | 1100万美元 |
| 投资方 | B Capital领投,Redpoint参与 |
| 总部 | 旧金山 |
| 创始人 | Shawn Song(联合创始人兼CEO)、Alex Yin(CTO)、Keli Li(COO)、Trista Taylor(CMO) |
| 官网 | https://sonilo.com |
把“画面先于声音”做成模型结构,而不是产品功能
Sonilo对自身技术差异的描述,集中在“时序绑定”四个字上。据公司披露,Sound World Model不把音乐与音效作为独立片段处理,而是读取场景运动与情绪变化后,生成针对该素材的音频。这意味着系统需要同时理解画面内容、节奏变化和情绪走向,再决定配乐与音效在时间轴上的落点。
CEO兼联合创始人Shawn Song在公司声明中称:“我们构建Sonilo是为了理解视觉故事。你给我们素材,Sonilo逐帧理解正在发生的事情,包括节奏、情绪和故事,并生成自然贴合场景的音乐与音效。”这一描述把产品逻辑从“生成一段音乐”切换为“理解一段视频后生成声音”,前者是内容生成,后者更接近后期制作中的声音设计。
从团队背景看,这种路径选择并非偶然。据Variety报道,Shawn Song曾在TikTok负责多模态AI技术工作,并在卡内基梅隆大学接受训练;CTO Alex Yin在约克大学获得计算机音乐博士学位。多模态AI与计算机音乐的组合,恰好覆盖了视频理解与音频生成两个技术端点。COO Keli Li曾建立并运营TikTok全球音乐业务,拥有版权交易与音乐行业合作背景;CMO Trista Taylor负责产品与市场发布,据公司披露曾参与开发进入a16z Top 50榜单的消费级AI应用。这个四人组合中,两人偏技术、两人偏商业化与版权,结构上对应了生成式音频公司最需要同时解决的两个问题:模型能力与版权合法性。
不过,公司尚未披露Sound World Model的参数量、训练数据规模、生成音频时长上限、延迟指标或与现有视频生成模型的技术兼容细节。从已披露的信息看,可以确认的是其技术路线强调视频与音频的联合处理,而非先独立生成音频再事后对齐;但“逐帧理解”的具体实现方式、对长视频的上下文保持能力、以及在复杂场景中音效与音乐分层生成的精细度,均未在公开材料中给出可核验的技术指标。
两条输入路径背后,是对AI视频工具链的卡位意图
Sonilo的产品设计允许用户通过两种方式生成音频:上传视频让模型自动匹配,或输入文字描述。这个双入口设计在商业上指向两类不同的使用场景。视频输入路径服务于已经生成画面、需要快速完成声音设计的创作者;文字输入路径则兼容更传统的AI音乐生成习惯,降低新用户的迁移成本。
从分发策略看,Sonilo没有选择先做一个独立消费者应用,而是先进入开发者平台和创作者聚合网络。据公司披露,AI创作者聚合平台TapNow与ComfyUI已签约成为早期分发合作伙伴。ComfyUI是当前AI图像与视频工作流中广泛使用的节点式工具,其用户群体高度依赖模块化组合。Sonilo以节点或插件形式进入ComfyUI生态,意味着它试图成为AI视频生成链条中的一个标准音频模块,而不是一个需要用户单独打开的外部工具。
这种策略与B Capital的投资判断形成呼应。B Capital普通合伙人Daisy Cai在投资方声明中称:“我们相信生成式音频将成为AI原生视频技术栈的重要组成部分。Sonilo之所以突出,是因为它的多模态技术为创作者提供了两种生成音乐和音效的方式:用文字描述他们想要的,或者提供视频让模型生成贴合场景的音频。”这段话将Sonilo放在“AI原生视频技术栈”的框架中评估,而非单纯的音乐生成赛道。从投资逻辑看,B Capital押注的是视频生成爆发后,音频作为配套层被模块化集成的需求。
但需要区分的是,“生成式音频将成为AI视频技术栈的标配”目前仍是投资方判断,而非已被验证的市场事实。AI视频工具链的音频环节是否会被独立公司占据,还是被Runway、Pika、可灵等视频生成平台内化为自有功能,仍是一个开放问题。Sonilo的卡位是否成立,取决于它在开发者平台中的实际调用量、留存率,以及视频生成平台是否愿意长期依赖外部音频模块。
版权结构比模型能力更早接受商业检验
生成式音频公司面临的约束,与生成式图像或文本公司有一个关键不同:音乐版权体系更集中、更强势,且对训练数据来源的合法性要求更严格。Sonilo在版权侧的动作,比多数早期AI音频公司更早也更具体。
据公司披露,Shutterstock是Sonilo的早期授权合作伙伴。Sonilo称其模型基于授权音乐学习,艺术家与版权方获得授权费及收入分成。公司还表示正在与主要版权机构敲定出版与母带录音协议,预计数周内完成。COO Keli Li在TikTok全球音乐业务的经历,显然被用于加速这一进程。
从商业模式看,Sonilo的收入结构可能包含三层:面向创作者和企业的音频生成平台使用费、面向开发者平台的分发或API收入、以及版权授权体系中的分成成本。公司未披露定价、客户数量或收入数据,因此无法判断其商业化进度。但版权成本结构是明确的:如果模型基于授权音乐训练,且艺术家与版权方获得授权费加收入分成,那么每一次生成都可能产生边际版权成本,或者至少需要在定价中覆盖固定的授权费用。这与使用自有或合成数据训练的模型相比,毛利率结构不同。
Shutterstock作为早期授权合作伙伴的意义,在于为Sonilo提供了一条可公开说明的训练数据合法性路径。但Shutterstock音乐目录的规模、风格覆盖和与主流商业配乐需求的匹配度,公司未披露。与主要版权机构的出版与母带录音协议尚未最终完成,这意味着Sonilo目前能够合法用于商业用途的音乐范围,可能仍受限于已签约的授权方。在协议落地之前,其“可直接商用”的承诺边界并不完全清晰。
短剧本地化是更具体的商业化切口,但尚未被验证
在Sonilo的目标客户中,短剧与内容工作室是一个值得单独拆分的群体。公司披露,其平台提供带唇形同步的AI配音,用于短剧与内容工作室的多语言本地化,无需在后期手工编辑。这个功能将Sonilo从“配乐工具”延伸到“音频本地化工具”,切入的是短剧出海和跨语言分发中的实际成本项。
短剧行业的多语言本地化,传统上需要配音演员、音频后期和同步调整,成本与周期都相对刚性。如果AI配音能够实现可接受的唇形同步和情感表达,确实可以压缩这一环节。但唇形同步的质量在短剧场景中尤其敏感:短剧的表演风格夸张、台词密集、情绪切换快,任何口型与声音的错位都会被观众迅速察觉。Sonilo尚未披露其AI配音的语言覆盖范围、唇形同步精度指标或与人工配音的成本对比,因此这一功能的实际可用性仍待验证。
从产业位置看,Sonilo同时提供配乐生成和AI配音,意味着它试图覆盖视频声音设计的两个主要层次:音乐音效层与对白层。如果这两个能力能够在同一系统中协同,理论上可以形成“画面理解—配乐—音效—配音”的完整声音管线。但这也意味着公司需要在两个技术方向上同时投入,而每个方向都有独立的竞争者和质量门槛。在1100万美元的融资规模下,资源分配的优先级将直接影响产品成熟度。
1100万美元的资本结构,与未披露的轮次信息
本次融资的金额为1100万美元,B Capital领投,Redpoint参与。但具体轮次未披露。SignalBase的融资条目将其标注为种子轮,但这一信息未在Variety的原始报道中得到确认,且SignalBase作为聚合平台,其轮次标注的准确性无法独立核实。从金额规模看,1100万美元处于种子轮与A轮之间的模糊地带;从投资方组合看,B Capital作为管理规模超过90亿美元的机构,通常参与更靠后的轮次,而Redpoint在早期AI投资中较为活跃。
B Capital成立于2015年,在美国与亚洲设有九个办公地点。其参与本轮,除了财务投资外,也可能与Sonilo在亚洲市场的分发潜力有关。短剧和短视频内容在亚洲市场的密度更高,而B Capital的跨区域布局可以为Sonilo提供进入亚洲创作者生态的通道。但这一推断仅基于B Capital的公开定位,公司双方均未披露具体的战略协同安排。
资金用途方面,公司明确列出三个方向:扩展模型所需的算力、扩大在创作者与开发者平台中的覆盖、建设音乐授权业务。这三个方向分别对应技术、分发和版权,与公司当前的主要瓶颈一致。算力支出是生成式模型公司的刚性成本,尤其是在视频理解与音频生成联合训练的场景下,计算需求可能高于纯音频模型。但公司未披露模型训练的具体规模、推理成本或单位生成成本,因此无法评估1100万美元能够支撑多长的技术迭代周期。
竞争格局中的位置:在AI音乐与AI视频之间寻找空隙
Sonilo所处的竞争空间,介于AI音乐生成与AI视频生成之间。AI音乐生成领域已有Suno、Udio等公司,它们以文字到音乐为核心,积累了较大的用户基础和模型迭代数据。AI视频生成领域则有Runway、Pika、可灵、即梦等平台,它们正在把音频能力逐步纳入自有产品。Sonilo的差异化在于把视频理解作为音频生成的输入条件,这在产品逻辑上更接近后期声音设计,而非独立的音乐创作。
但这个差异化也带来一个战略风险:如果AI视频平台决定自建音频模块,Sonilo作为外部供应商的空间会被压缩。视频平台拥有画面生成的原始数据、用户工作流和分发渠道,在视频与音频的联合训练上具有数据优势。Sonilo的应对策略是进入ComfyUI等中立开发者平台,成为跨平台的音频模块。这种策略的成立前提是:视频创作者的工作流足够分散,且开发者平台能够形成对视频平台自有工具的制衡。
从已披露的信息看,Sonilo的早期分发合作伙伴TapNow与ComfyUI均为平台型渠道,而非直接的内容创作者或企业客户。这意味着公司目前的策略重心是铺设接入点,而非直接获客。这种策略在早期可以快速扩大潜在触达面,但也意味着收入转化依赖于合作伙伴生态的活跃度,以及开发者是否愿意为音频模块单独付费。公司未披露与TapNow或ComfyUI的合作模式是免费接入、收入分成还是API计费,因此无法判断这些分发合作对收入的直接贡献。
待验证的假设:从“技术路径成立”到“商业闭环成立”
Sonilo的叙事建立在三个递进的假设上。第一个假设是技术路径成立:视频理解与音频生成的时序绑定,能够产生比“先选音乐后对齐”更好的用户体验。第二个假设是分发路径成立:通过开发者平台和创作者聚合网络,能够在AI视频工作流中占据音频模块的位置。第三个假设是版权路径成立:基于授权音乐训练,并让版权方获得分成,能够在商业上可持续地提供“可直接商用”的音频。
目前,第一个假设有团队背景和产品逻辑支撑,但缺乏公开的技术指标或用户测试数据。第二个假设有早期签约合作方,但合作深度、调用量和留存率均未披露。第三个假设有Shutterstock作为授权方,但主要版权机构的协议尚未完成,且授权成本对毛利率的影响未知。消费者应用计划于第四季度上线,这将是Sonilo第一次直接面对个人创作者,也是检验其产品体验和付费意愿的关键节点。
从已披露的1100万美元融资、B Capital与Redpoint的组合、以及Shutterstock的授权合作看,Sonilo在早期阶段完成了技术团队、资本背书和版权基础的三重搭建。但从“搭建完成”到“商业验证”之间,仍隔着模型性能、分发转化和版权成本三个未解变量。生成式音频能否成为AI视频技术栈的标配,不取决于一家公司的技术宣言,而取决于它能否在视频创作者的真实工作流中,持续替代掉那些今天仍然靠手工完成的声音决策。
验证边界与可复核指标
本文涉及的“首个、唯一、最大、领先”、订单、出货、性能等表述,如无另行说明,均是公司、创始人或投资方在现有公开材料中的披露口径;RecodeX未在本次采集材料中找到独立审计或第三方测试结论,因而不将其视为已经独立确认的事实。文中的产业协同、竞争位置和商业路径属于基于已披露产品与融资用途的编辑分析,不代表相关结果已经实现。
- 技术侧应核验第三方测试条件、样本规模、良率、稳定性及与可比方案一致口径的结果;
- 商业侧应核验去重后的付费客户、可执行合同、收入确认、复购率以及订单转化;
- 资本与产业协同应以工商股权、关联交易、联合开发、采购或量产文件为准。
RecodeX 极客视:Sonilo的真正赌注不是“AI能生成音乐”,而是“AI能看懂画面后再决定声音”。这个顺序的颠倒,把公司从AI音乐的红海挪进了AI视频工作流的缝隙。但缝隙之所以还是缝隙,是因为它尚未被证明足够宽、足够深,也尚未被证明不会被两侧的巨头顺手填平。
信息来源
本文在采集与核验阶段引用了以下公开来源,按站点去重列出;来源内容归原发布方所有,其口径不代表 RecodeX 的核实结论。
