语音正在成为 AI 的默认界面。这个判断在 2026 年的今天已无争议——OpenAI 把语音能力嵌入了每个产品入口,Google 将 Gemini 的语音交互打磨得愈发自然,而支撑这一趋势的底层语音合成技术,却陷入了一场集体困境:大多数模型能把字念对,但念不出情感、节奏和语境。一句话听起来没问题,十句话之后,那种机械感就渗出来了。

这是语音 AI 行业一道隐蔽的分水岭。“把词读准”和“把话说到位”被长期当作同一个问题,实则前者处理文本到音素的转换,后者需要理解一段话里哪里该停顿、哪个词该加重、什么语气才符合场景。绝大多数团队把研发资源堆在前者,却让后者停留在“够用就行”的水平。直到一批新公司开始从另一个方向解题——先搞定表达力,再从表达力倒推架构。

Fish Audio 是这条路线上的激进实践者。2026 年 7 月 28 日,这家总部位于 Palo Alto 的公司宣布完成 5200 万美元种子轮融资,距离它作为一个副业项目跑出第一版模型仅仅过去一年。该轮融资由 Coreline Ventures 和 Capital Today 共同领投,参投方包括 359 Capital、Play Time、HF0、645 Ventures、Parable、Carya Venture Partners、Alphalist Partners、Bayhouse Ventures 以及多位天使投资人。

字段 内容
公司 Fish Audio
轮次 种子轮
金额 5200 万美元
投资方 Coreline Ventures、Capital Today(共同领投),359 Capital、Play Time、HF0、645 Ventures、Parable、Carya Venture Partners、Alphalist Partners、Bayhouse Ventures 及多位天使投资人
总部 Palo Alto
创始人 Shijia Liao(联合创始人兼首席科学家)、Rissa Cao(联合创始人兼 CEO)
官网 https://fish.audio

用一张 4090 打出来的技术底子,押注了行业两年后才追上的架构

Fish Audio 的技术故事没有发生在大模型实验室的千卡集群里。联合创始人兼首席科学家 Shijia Liao 曾是 NVIDIA 的视频研究员,业余时间沉迷 VTuber 和动漫内容,他对合成语音的不满来自一个很具体的场景:角色配音听起来没有灵魂。他在自己卧室用一张 RTX 4090 开始训练语音生成模型,当时做了一个关键的技术决策——采用双自回归架构。

根据公司博客披露,这个架构选择领先了行业大约两年。自回归模型天然擅长捕捉序列中的长距离依赖关系,这对语音的韵律、停顿、语调变化至关重要。Fish Audio 将文本理解和语音生成分别建模,使得模型在“把词读准”之外,能够独立优化“怎么读”的问题。这种架构与主流的端到端方案形成差异,后者的优势在于简化流程,但在控制力和表达力的精细度上长期受限。

该架构的实际表现转化为一组硬指标:最新模型 S2.1 Pro 在单张 H200 上实现每秒超过 8000 tokens 的推理速度,支持 83 种以上语言和 15000 多种自然语言控制参数,覆盖词级情感调控。语音克隆仅需 5 秒音频片段,约 15 秒完成。在盲听测试中,S2.1 Pro 以约 67% 的偏好率胜出主要竞品——这是一个相对优势,但也意味着仍有约三分之一听众未选择它,竞争远未结束。

开放模型策略是 Fish Audio 技术扩散的另一条腿。公司从 Fish Speech 这个开源项目演化而来,GitHub 仓库已积累超过 31000 颗星标,社区声音库收录超过 200 万个声音。过去一年发布了 5 个模型:4 个语音生成模型和 1 个语音转文本模型。其中 3 个语音生成模型已开源,但最新最强的 S2.1 Pro 仅通过付费 API 提供。这是一种“基座开源、旗舰闭源”的策略——用免费模型压低开发者准入门槛,在最高性能层和高级功能上实现货币化。

2100 万美元年收入背后,模型表现随使用量增长的正循环

Fish Audio 声称其年化经常性收入达到 2100 万美元,用户超过 800 万。对于一个成立仅一年的公司,这个收入规模在种子轮阶段相当罕见。公司披露其收入结构中,企业客户与开发者合计约占三分之二,其余来自创作者。

拆解其收入增长逻辑,有几条线索值得注意。首先,开放模型充当了一个高效的分发渠道。31000 个 GitHub 星标意味着大量开发者在自有环境中测试过 Fish Speech 的基础能力,其中一部分转化为付费 API 或企业版客户,获客成本天然低于纯闭源竞品。其次,公司声称其模型通过后训练不断吸收真实用户偏好数据,形成“使用越多—模型越好—用户越多”的正反馈循环。这一点在口音较重或非标准美式英语场景中体现尤为明显:公司特别强调模型在中英日韩西等语言上的表现,正是因为用户在这些语言上贡献了大量使用数据,训练出了闭源竞品难以复现的语料优势。

但这一增长叙事有其待验证的脆弱性。2100 万美元 ARR 的具体构成——API 调用收入、创作者订阅、企业合同各自占比多少——公司未做披露。如果收入高度依赖少数大客户的年度合同,ARR 指标的稳定性就需要打折。此外,800 万用户中有多大比例是免费社区版使用者、多大比例转化为付费用户,也没有公开数据。公司博客提到团队规模仅 22 人,意味着人均年化收入接近 100 万美元,这是极高的效率指标,但也可能反映出团队尚未进入需要大规模投入市场推广和客户成功的阶段。

ElevenLabs 盘踞的市场里,服务谁比技术参数更重要

AI 语音合成赛道已相当拥挤。ElevenLabs 是最直接的参照系,它在创作者工具和配音市场建立了品牌认知,闭源模型通过声音库和付费订阅获得收入。Cartesia 走的是低延迟路线,主攻需要实时语音交互的对话式 AI 场景。Async(原 Podcastle)偏重内容创作工具链。每家公司都在差异化自己的主战场。

Fish Audio 的定位切入了一个特殊地带:它试图同时服务个人创作者和需要本地化部署的强监管企业。在创作者侧,开放模型让独立开发者、游戏工作室、动漫配音社区可以免费调用,降低了实验成本,这批人也是最早推动 Fish Speech 增长的核心群体。在企业侧,公司提供本地部署选项、零数据留存政策和 HIPAA 合规配置,瞄准的是金融、医疗等对数据主权敏感的行业。已披露的客户名单覆盖了不同场景:HeyGen 用其语音驱动 AI 虚拟形象,Retell 和 LiveKit 用其构建语音代理,Telnyx 和 Sanas 将其集成到通信基础设施中。

这种两头通吃的策略让商业模型很分散,但也意味着它必须在多个战场上同时保持竞争力。在创作者市场,ElevenLabs 的品牌、社区和声音库规模构成壁垒;在企业市场,客户对服务等级协议、安全认证和技术支持的要求远超个人用户,对于一个 22 人的团队而言,是否能同时做好开发者文档、开源社区维护、企业销售和合规服务,是一道资源分配的难题。

值得注意的是,Fish Audio 的策略与当前种子轮 AI 投资的宏观趋势方向相符:投资者正从押注通用基础大模型转向垂直模态领域的差异化玩家。与 OpenAI、Anthropic 或 Google 在通用语音能力上直接竞争需要巨大算力投入,但在语音合成这个垂直方向上,一个小团队通过架构创新和社区分发,有可能在特定指标上跑赢巨头。

Coreline 和 Capital Today 联手进场,资本结构背后的意思

本轮由 Coreline Ventures 和 Capital Today 共同领投,这是一个值得拆解的组合。

Coreline Ventures 管理合伙人 Osuke Honda 在官方声明中给出的投资逻辑很直接:“语音正在成为 AI 的默认界面,Fish Audio 在性能、多语言支持、情感表达和成本上都建立了领先优势。”他将 Fish Audio 定位为“创作者、开发者和企业的默认选择”。

359 Capital 合伙人 Rico Mallozzi 在接受 TechCrunch 采访时则强调了团队的技术效率:“他们用这么小的团队,就能在模型质量上缩小人工语音和真实人声之间的差距,相比那些资金充裕的 AI 实验室,这显示了他们的技术判断力。”这一评价直指 Fish Audio 的竞争力内核——不是靠算力规模碾压,而是靠架构选择和数据飞轮撬动效率。

但资本结构更值得关注的细节在于:据公司博客透露,天使投资人在公司还没有太多东西可看的时候就投了钱。这意味着早在开源项目形成社区吸引力之前,就有一批人押注了 Shijia Liao 的技术路线和创始人团队。5200 万美元的种子轮对一家仅 22 人的公司而言是笔巨款,远超维持当前业务运转所需的金额,这也解释了公司 CEO Rissa Cao 此前的表态:当作开源项目运营时公司不需要外部资本,开始寻求融资是因为要开发更先进的模型并满足企业需求。

估值未披露,这是该轮信息中一个显眼的缺口。对于一个年化收入 2100 万美元、用户 800 万的公司,5200 万美元种子轮对应的估值倍数可以用多种方式推算,但在缺乏官方数据的情况下,任何估算都属于推测。可以确定的是,这个融资规模在种子轮序列中已属头部。

资金瞄准音频理解模型和语音原生 LLM,从“生成声音”走向“理解声音”

Fish Audio 的资金用途披露得相当具体。首先是扩展模型矩阵:从文本转语音向整个音频原生技术栈延伸,包括语音原生大语言模型(voice-native LLM)、语音到语音模型(speech-to-speech),以及一个计划年内发布的音频理解模型(Audio Understanding LM)。

这个路线图意味着 Fish Audio 不再满足于做一个“语音合成工具”,而是试图占据 AI 语音的完整价值链。文本转语音处理的是“说出话”,音频理解模型要解决的则是“听懂话”——情感识别、语境判断、对话意图捕捉。语音到语音模型更是将理解和生成打通,实现真正的端到端对话能力。如果这些模型成功落地,Fish Audio 将从配音和虚拟角色场景扩展到实时对话领域,与语音代理、AI 客服、虚拟陪伴等更大的市场交汇。

其次是建立企业销售团队,这意味着公司将从开发者和创作者驱动的自助服务模式,转向主动拓展大型客户。这是一个组织能力和文化上的跨越:开源社区的运营逻辑是透明、即时反馈、社区优先;企业销售的逻辑是关系维护、合规流程、定制化服务。两者如何在一个 22 人团队内共存,是一个典型的规模化挑战。

第三是深化与 LiveKit 和 Retell 等合作伙伴的开发者工具集成,将语音能力嵌入更广泛的实时通信和 AI 代理基础设施中。这种集成策略的逻辑是:与其单独获客,不如进入别人的工作流,成为默认选项之一。

声音版权纠纷暴露开放模型的阿喀琉斯之踵

Fish Audio 的增长故事有一个绕不开的阴影:声音版权争议。

公司在构建声音库时采用了一种社区驱动模式——允许用户提交自己的声音用于训练模型,并对被使用的声音提供补偿。这个机制的问题在于,它无法阻止用户上传不属于自己的声音。几个月前,有声音创作者公开指控自己的声音在未经同意的情况下被克隆并出现在 Fish Audio 的平台上。英国配音艺术家 Faye Dicker 在接受 BBC 采访时称,她的声音被下载超过 900 次。公司虽设有 DMCA 版权移除流程,但响应速度很慢,引发负面报道。

CEO Rissa Cao 随后对 TechCrunch 表示,公司已将该流程自动化,创作者只需提交一段短音频或合同证明所有权,声音可在三分钟内被移除。这一改进降低了维权门槛,但回避了问题的根源:在自动化移除完成之前,侵权声音可能已被大量使用乃至二次传播。而权利人往往需要先发现自己被侵权,才能发起申诉——发现成本完全落在受害者一方。

Coreline Ventures 合伙人 Osuke Honda 对此的评论反映出投资人对这一风险的清醒认知:“社区驱动模式只有在创作者信任平台时才可能成为持久优势。这意味着授权同意、透明度和署名必须嵌入产品本身,而不是事后补救。”他还补充,行业需要走向“验证过的声音所有权、清晰的授权条款、便捷的举报和移除流程,以及最终让创作者在声音被商业使用时获得收益分成的模式”。

这段表态值得逐字阅读。它一方面承认当前机制不够,另一方面将解决方案指向了一个远比技术更复杂的目标——建立一个覆盖声音确权、授权、收益分配的完整产权体系。这已超出 Fish Audio 单家公司的能力边界,需要行业共识甚至监管介入。而在此之前,每一起侵权争议都可能演变成对平台信任的侵蚀。对于一家以社区和开放为增长基石的的公司,信任一旦松动,用户上传声音的意愿就会下降,社区声音库的飞轮也就随之减速。

从副业到 5200 万美元,要跨过的不止是技术成熟度

Fish Audio 正在讲述的是一个经典的技术理想主义故事:一个研究员因为对现有产品的不满,在卧室里靠一张消费级显卡做出一个开源项目,一年后变成 800 万用户和千万级收入的公司,然后获得顶级 VC 的大额注资。这个故事里的每一个节点——技术洞察、社区增长、商业转化——踩对了当下 AI 创业最被推崇的节奏。

但在叙事和现实之间,还有一些必须被验证的命题。

其一,2100 万美元 ARR 的质量有待更多信息披露。收入中一次性项目合同与重复性订阅的各自占比、客户集中度、续费率——这些数字决定了 ARR 能否持续增长还是可能波动。公司迄今没有公开这些细节。

其二,从 22 人扩展到能同时服务创作者社区和企业客户的组织,这段路没有捷径。企业客户需要的是承诺和流程,开源社区需要的是响应和透明,两套逻辑并不天然兼容。一旦资源向企业端倾斜,社区贡献者是否会感到被冷落,是一个需要持续管理的问题。

其三,音频理解模型和语音原生 LLM 的研发进入的是一个比语音合成竞争更激烈的领域。OpenAI、Google 和 Anthropic 都在推进多模态模型的语音能力,它们的资源规模和人才密度远超一家种子轮公司。Fish Audio 必须证明自己在垂直语音方向上的技术积累足够深厚,能在一个巨头环伺的赛道里找到生存空间。

其四,声音版权问题的解决方案目前停留在“更快地移除”层面,本质上是被动的。如果不建立前置的声音授权和验证机制,每一次侵权事件都会消耗来之不易的社区信任。而在监管环境尚不明朗的情况下,行业自律能走到哪一步,无人能给出确定答案。

Fish Audio 的创始团队反复传递一个信念:把模型做好,人们就会发现。800 万人发现了,印证了需求的真实。但把“发现”转化为持续的“选择”和“付费”,需要回答的问题比技术参数更多。

RecodeX 极客视:Fish Audio 用一张 4090 和双自回归架构赌赢了一年时间窗口,开源社区带来的分发优势让它在没有市场团队的情况下拿到 800 万用户。但下一程的秘密不在于 S2.1 Pro 能否跑赢更多盲测,而在于声音版权这个结构性问题能不能从“三分钟移除”进化成一套创作者真正愿意信任的规则。5200 万美元买到的不是发育时间,是解决这个问题的最后机会。