Wispr Flow 获 2.8 亿美元 B 轮融资:语音 AI 能否在巨头夹击下突围?
当 OpenAI、Anthropic 和 Google 把“智能”本身推向一个又一个基准测试的极限时,一个更原始的问题被搁置在桌面上:普通人到底怎么把意图告诉机器?键盘仍然是主流答案,但它的效率天花板在过去四十年里几乎没有移动过。语音输入存在了至少二十年,却始终没能成为默认交互方式——不是因为人们不想说,而是因为机器在真实世界里听不清、听不懂、听不准。车载蓝牙的杂音、开放办公室的邻座对话、非母语口音、窗外的风声,这些日常场景足以让大多数语音识别系统崩溃。
Wispr 这家旧金山公司试图从“听写”这个最窄的口子切入,去解决这个被巨头长期搁置的问题。2026 年 8 月 17 日,Wispr 宣布完成 2.8 亿美元 B 轮融资,投后估值 20 亿美元,由 Menlo Ventures 领投,Notable Capital、NEA、Neo Ventures、8VC 等现有投资者参与,新进入者包括 Acrew、Forerunner、Goodwater、Plus Capital、Peak XV 等机构,以及一批职业运动员。公司累计融资额达到 3.61 亿美元。
这轮融资距离上一轮仅过去约六个月。据 Lookonchain 来源,Wispr 的上一轮为“超额认购的 A2 轮”。在如此短的时间内估值跳升,核心支撑来自一组增长数据:据公司披露,过去四个季度营收增长均超过 150%,产品已生成超过 600 亿字。但不同来源对客户数量的表述存在明显冲突——Fortune 称“数百万消费者和 100,000 家企业”,Lookonchain 称“超过 125,000 家企业”,TechStartups 则称“超过 10,000 家企业”。这一差异本身就是一个值得注意的信号。
| 字段 | 内容 |
|---|---|
| 公司 | Wispr(产品名 Wispr Flow) |
| 轮次 | B 轮 |
| 金额 | 2.8 亿美元 |
| 投资方 | Menlo Ventures 领投;Notable Capital、NEA、Neo Ventures、8VC、MVP Ventures、Acrew、Forerunner、Goodwater、Plus Capital、Peak XV、Together Fund 及多名运动员参与 |
| 总部 | 旧金山 |
| 创始人 | Tanay Kothari、Sahaj Garg |
| 官网 | https://wisprflow.ai/ |
从可穿戴到“沉默语音”,两年迷路后才踩中听写
Wispr 的故事起点并不在听写软件。创始人 Tanay Kothari 和 Sahaj Garg 是斯坦福大学一年级室友,2021 年共同创立公司。Kothari 在 Fortune 的报道中反复提到一个童年意象:2008 年他 10 岁时,吸引他的不是钢铁侠托尼·斯塔克,而是那个会说话的 AI 管家 JARVIS。这个意象贯穿了 Wispr 的产品叙事,但创业初期的现实远没有电影那么流畅。
据 Fortune 报道,两人在创业早期“在创业荒野中徘徊”,先后尝试了可穿戴设备和“无声语音”(silent speech)——一种允许用户不发出声音就能控制计算机的界面。这些方向都没有跑通。直到大约两年前,他们才把重心转向听写软件 Wispr Flow。从时间线推算,这个转向发生在 2024 年前后,恰逢大语言模型开始显著提升语音转写后的文本处理能力。换句话说,Wispr Flow 的诞生并非源于语音识别技术的突破,而是源于 LLM 让“识别之后做什么”变得有价值。
这个转向的时机解释了为什么一家成立五年的公司直到最近才进入高速增长轨道。它也意味着 Wispr 的护城河并不在语音识别的底层技术上——至少在过去两年里不是。公司直到本轮融资才首次推出自研语音识别模型 Canto,此前大概率依赖第三方模型或混合方案。这一点公司未明确披露,但从产品演进逻辑看,先做应用层、再下沉到模型层,是这轮融资叙事中最重要的战略信号。
Canto 模型押注“真实世界的语音”,但基准测试的参照系并不透明
与融资同步,Wispr 宣布预览其首个自研语音识别模型 Canto。公司 CEO Tanay Kothari 在 TechStartups 引述的声明中称,大多数语音模型“在安静的房间、好的麦克风、模型听过很多次的口音”下训练和评估,而“几乎没有人生活在那些条件下”。据公司披露,Canto 在“背景噪音、风、重口音或音乐”等最困难条件下,将错误率从“超过 30%”降至“5% 到 10%”。
这个数据需要被审慎对待。首先,公司没有披露对比的基线系统是什么——是 Wispr Flow 之前使用的第三方模型,是某个开源模型,还是某个商业 API?其次,错误率的定义(词错误率 WER 还是字符错误率 CER)、测试集构成、语言范围、口音样本量,均未公开。第三,5% 到 10% 的区间宽度本身说明性能在不同条件下波动显著。在没有独立第三方基准测试的情况下,这个数字只能作为公司口径存在,不能作为行业事实引用。
不过,Canto 的推出方向本身有真实的产业逻辑。语音识别领域长期存在“实验室性能”与“现场性能”之间的巨大落差。如果一个模型只在安静环境下表现好,它在车载、街头、开放办公室等场景中的实用性就会大打折扣。Wispr 选择把资源投向“真实世界语音”这一差异化定位,与它作为应用层公司积累的用户数据直接相关——据公司披露,Flow 已生成超过 600 亿字,这些数据如果被用于训练,确实可能构成一个竞争对手难以复制的语料池。但公司未披露这些数据是否用于 Canto 的训练,也未披露数据来源的合规框架。
“不是听写市场”:Menlo 的赌注是语音成为 AI 的默认输入层
Menlo Ventures 合伙人 Matt Kraning 在本轮融资中的表态值得逐句拆解。他在给 Fortune 的邮件中写道:“这不是一个听写市场。听写是你进门的方式。人们付费的是不用打字,这让你与工作流工具、会议工具,最终与每个 AI 模型前面的文本框竞争。实验室大多已经解决了智能问题。没有人解决一个普通人如何告诉它自己想要什么。”
这段话的信息量在于:Menlo 并不把 Wispr 当作一个听写工具来估值,而是把它当作“AI 交互入口”来估值。这个逻辑与语音 AI 赛道近期的资本热度一致。AI Weekly 的报道提到,本轮融资“落入语音领域一个繁忙的时期”,此前 ElevenLabs 在 2026 年第一季度锚定了一轮 70 亿美元的语音 AI 融资潮。从资本结构看,Wispr 的 20 亿美元估值在语音 AI 初创公司中处于什么位置,取决于你拿它和谁比——ElevenLabs 的估值更高,但其收入结构和产品形态与 Wispr 并不完全相同。
Menlo 的论点的核心假设是:语音将成为人类与 AI 交互的默认输入方式,而“听写”只是这个趋势的第一站。这个假设的验证路径是清晰的——如果 Wispr 的用户增长和营收增长能够在未来几个季度继续维持 150% 以上的增速,且收入来源从单纯的听写扩展到会议记录、工作流自动化等场景,那么“入口”逻辑就成立。反之,如果增长主要来自听写这一单一场景,且用户付费意愿在免费替代品面前不够强,那么 20 亿美元估值就建立在一个尚未被证明的扩展叙事上。
巨头环伺:Apple、Google、Microsoft 的语音能力是免费的
Wispr 的竞争格局有一个残酷的底色:它最大的竞争对手提供的语音功能是免费的,而且预装在数十亿台设备上。Apple 的 Siri 和听写、Google 的语音输入和 Assistant、Microsoft 的 Windows 语音输入和 Copilot 语音功能,都是操作系统层级的默认选项。Anthropic 和 OpenAI 则在 API 层面提供语音识别和语音交互能力,任何开发者都可以用极低的成本集成。
Wispr 的差异化逻辑建立在两个支点上。第一个是“真实世界语音”的准确性。如果 Canto 确实能在嘈杂环境下显著优于系统默认的语音识别——这是一个尚未被独立验证的“如果”——那么对于高频、专业化的听写需求,用户可能愿意安装一个独立应用。第二个是“信任”。联合创始人 Sahaj Garg 在 Fortune 报道中称:“隐私和安全对我们来说不是功能:它们是赢得对你生活的环境级访问权的基础。”这个表述暗示 Wispr 的长期产品方向是“环境级”的持续语音交互,而这恰恰是隐私敏感度最高的场景。
但“信任”作为竞争壁垒有一个内在矛盾:巨头在隐私合规和用户数据保护上拥有更成熟的体系和更低的边际成本。Apple 可以拿“端侧处理”作为隐私卖点,Google 和 Microsoft 则拥有企业级安全认证和合规体系。Wispr 作为一家 2021 年成立的初创公司,要在“环境级访问”这个最敏感的领域建立信任,需要的不仅是技术能力,还有时间、透明度和安全记录。这些都不是一轮融资能买到的。
客户数量口径打架,营收增长的“质量”比“速度”更值得追问
Wispr 的增长数据存在一个无法回避的问题:不同来源对客户数量的表述不一致。Fortune 报道称“数百万消费者和 100,000 家企业”,Lookonchain 称“超过 125,000 家企业”,TechStartups 则称“近所有财富 500 强公司和超过 10,000 家企业”。这三个数字之间的差异不是小数点的误差,而是数量级的差异。10,000 和 125,000 之间差了 12.5 倍。
这种差异可能源于统计口径的不同:企业客户的定义是什么?是付费企业账户的数量,还是“有员工使用过”的企业数量?“近所有财富 500 强公司”这个表述尤其模糊——如果一名员工在个人设备上安装了 Flow 并用公司邮箱注册,这家公司是否就算作“使用 Wispr 的财富 500 强公司”?TechStartups 的表述“近所有财富 500 强公司和超过 10,000 家企业”与 Fortune 的“100,000 家企业”之间的矛盾,说明公司在不同渠道传递的信息可能存在选择性放大。
营收增长“过去四个季度均超过 150%”这个数据同样需要放在上下文中理解。如果基数很小,150% 的增速并不难实现。公司未披露绝对营收数字、付费转化率、企业客户的平均合同价值、客户流失率等关键指标。在缺乏这些数据的情况下,“150% 增长”只能说明产品有真实的使用需求,但无法说明商业模式的可持续性。Wispr 的商业模式本身也未披露——是订阅制、按使用量计费,还是企业授权?这些信息的缺失让外部很难判断 20 亿美元估值对应的收入倍数是否合理。
运动员投资人进入资本表,品牌效应与信号意义并存
本轮融资的投资者名单中出现了大量职业运动员:Joe Burrow、Shaun White、Klay Thompson、Paul George、Livvy Dunne、Dak Prescott、DK Metcalf、Kyle Hamilton、Aaron Gordon、Alex Caruso、Domantas Sabonis、Trae Young。这个名单的长度和知名度在 B 轮融资中并不常见。
运动员投资人进入资本表的直接作用是品牌曝光。语音输入是一个面向大众消费者的产品类别,运动员的社交影响力可以帮助 Wispr 触达更广泛的用户群体。但这也带来一个信号问题:当一轮融资的投资者名单中有十余名运动员时,市场可能会问,这是否意味着传统机构投资者的需求不足以填满这轮融资?从披露信息看,Menlo Ventures 领投,NEA、Notable Capital 等机构参与,说明机构需求是存在的。但运动员的集中出现,至少在叙事层面模糊了“机构信心”和“品牌营销”之间的边界。
从资本结构看,本轮融资的领投方 Menlo Ventures 是“长期投资者和合作伙伴”,据 Lookonchain 来源,这是 Menlo 在 AI 公司中最大的投资之一。现有投资者 Notable Capital、NEA、Neo Ventures、8VC 的持续参与,说明早期股东对公司方向保持信心。但值得注意的是,Fortune 和 TechStartups 的投资者名单存在差异——TechStartups 包含了 MVP Ventures 和 Together Fund,而 Fortune 的名单中没有提及这两家。这种差异可能源于披露口径的不同,也可能反映了不同来源对“参与”的定义不同。
资金用途指向模型层下沉和市场扩张,但“零编辑率”才是真正的北极星
据 PANews 引述 TechCrunch 的报道,本轮资金将用于“扩展语音转录和会议笔记等产品、推出新语音模型 Canto,以及扩大在印度和英国等市场的影响力和硬件合作”。TechStartups 的报道则提到,Wispr 内部追踪一个名为“零编辑率”(zero edit rate)的指标,衡量听写文本无需修改即可直接使用的比例。
“零编辑率”这个指标比“错误率”更接近用户真实体验。一个词错误率 5% 的系统,在实际使用中可能意味着每二十个词就需要修改一次——对于长文本听写来说,这个频率仍然很高。Wispr 没有披露其当前的零编辑率数据,但把这个指标作为内部追踪目标,说明公司理解语音输入的核心瓶颈不是“识别了多少词”,而是“用户需要改多少字”。
资金用途中“印度和英国市场”的提及值得注意。印度是一个多语言、多口音的市场,对语音识别系统的鲁棒性要求极高;英国则是一个英语市场,但口音多样性远超美国。选择这两个市场作为扩张重点,与 Canto 的“真实世界语音”定位一致。但这也意味着 Wispr 将进入一个本地化成本高、竞争激烈的战场——Google 在印度语音识别市场有深厚积累,而英国的语音 AI 生态也相当成熟。
风险与待验证假设:从听写工具到交互入口的跨越有多远
Wispr 的核心叙事面临三个待验证假设。第一,Canto 模型的性能优势是否真实存在且可持续。公司披露的错误率数据缺乏独立验证,且语音识别是一个快速进步的领域——巨头和开源社区都在持续改进模型。即使 Canto 今天在特定场景下有优势,这个优势的保质期有多长,是一个开放问题。
第二,用户是否愿意为“不用打字”付费。听写功能在操作系统层面是免费的,Wispr 的付费转化需要建立在显著的体验差异上。如果 Canto 的“零编辑率”足够高,用户可能愿意付费;如果差异不够大,免费替代品就足够用了。公司未披露付费转化率和客单价,这让外部无法判断其收入质量。
第三,“环境级语音交互”的隐私边界。Garg 所说的“环境级访问”是一个极具野心的产品愿景,但它同时触及了用户对持续监听的深层恐惧。Wispr 需要在产品设计和数据政策上做出比巨头更透明的承诺,而这一点目前还停留在创始人的表态层面,缺乏具体的产品机制和第三方审计的验证。
从已披露的融资节奏、营收增速和产品方向看,Wispr 确实抓住了语音 AI 从“技术演示”走向“日常工具”的窗口期。但 20 亿美元估值所隐含的期待,远超一个听写工具所能承载的范围。Menlo 的“入口”逻辑如果要兑现,Wispr 需要在未来 12 到 18 个月内证明三件事:Canto 的性能优势经得起独立检验,付费用户增长不依赖一次性营销驱动,以及“环境级”产品愿景不会在隐私问题上翻车。这三件事中的任何一件失败,都足以让当前的估值叙事出现裂缝。
验证边界与可复核指标
本文涉及的“首个、唯一、最大、领先”、订单、出货、性能等表述,如无另行说明,均是公司、创始人或投资方在现有公开材料中的披露口径;RecodeX未在本次采集材料中找到独立审计或第三方测试结论,因而不将其视为已经独立确认的事实。文中的产业协同、竞争位置和商业路径属于基于已披露产品与融资用途的编辑分析,不代表相关结果已经实现。
- 技术侧应核验第三方测试条件、样本规模、良率、稳定性及与可比方案一致口径的结果;
- 商业侧应核验去重后的付费客户、可执行合同、收入确认、复购率以及订单转化;
- 资本与产业协同应以工商股权、关联交易、联合开发、采购或量产文件为准。
RecodeX 极客视:Wispr 的融资故事里最值得关注的不是 2.8 亿美元这个数字,而是它试图回答一个被巨头搁置了二十年的问题:为什么语音输入至今没有取代键盘?答案可能不在模型精度上,而在“信任”这个更模糊的维度里。如果 Canto 真的能把嘈杂环境下的错误率压到个位数,并且用户愿意把“环境级访问权”交给一家初创公司,那么 Wispr 就有机会在 Apple 和 Google 的阴影下长出一个独立的入口。但在那之前,20 亿美元估值更像是对一个尚未被验证的交互范式的期权定价,而不是对一个成熟商业模式的确认。