当语音AI的“最后一公里”卡在数据主权上

一家德国保险公司的呼叫中心里,客户正在电话中描述一起理赔事故。系统需要在几百毫秒内理解带萨克森口音的德语、捕捉语气中的焦虑、识别街道名称和门牌号,然后给出既准确又符合监管要求的回应。这不是一个单纯的技术演示场景,而是欧洲受监管行业每天都在面对的约束:语音数据不能随意流向美国云服务商,响应不能慢到让对话失去自然节奏,而一个被误听的人名或地址可能意味着合规事故。

过去几年,语音AI的叙事主要由美国公司主导。ElevenLabs、OpenAI、Google和xAI在实时语音模型上投入了大量算力与资本,欧洲企业若想使用这些能力,往往只能通过API接入,把音频数据交给位于其他司法辖区的服务器。对于银行、保险、医疗和政府机构而言,这条路在数据保护与监管审查面前经常走不通。于是问题变得具体:欧洲有没有自己的语音到语音模型,既能在延迟上与美国产品竞争,又能把数据留在可验证的欧洲基础设施里?

2026年10月1日,柏林语音AI公司Deepslate宣布完成770万欧元种子轮融资,试图用自研的端到端语音到语音模型回答这个问题。本轮由慕尼黑科技投资机构42CAP领投,Alstin Capital、现有投资方SIVentures及多位天使投资人参与。这笔钱不算大,但投向了一个在语音AI产业链中少有人走的位置——不是封装第三方模型的集成商,而是从音频编码器到推理核心再到语音解码器全部自己训练的模型实验室。

字段 内容
公司 Deepslate
轮次 种子轮
金额 770万欧元(约合880万美元)
投资方 42CAP(领投)、Alstin Capital、SIVentures(现有投资方)、多位天使投资人
总部 柏林
创始人 Paskal Paesler(CEO)、Jan Brachthaeuser(CTO)
官网 https://deepslate.eu

跳过文本中间层,把音频直接交给模型

传统语音AI的链路通常是三段式:先用语音识别把音频转成文本,再把文本送入语言模型处理,最后用语音合成把回答读出来。每一步转换都意味着信息损耗和延迟累积。Deepslate的做法是端到端处理——音频直接进入模型,音频直接返回,中间不经过文本转写。据公司披露,这种架构保留了语调、重音、方言和停顿等文本层无法完整承载的信息。

Deepslate将其模型命名为Opal,系统由三个自研组件构成:语音编码器将音频波形映射到语义与韵律向量空间;推理核心基于开放权重语言模型,由公司针对特定语言进行后训练;语音解码器则从推理嵌入中直接生成带有受控韵律和自然话轮转换的语音。这套架构的关键设计在于解耦:编码器和解码器通过可训练投影器连接到可替换的语言模型上。据公司披露,当新的语言模型代际出现时,只需重训投影器,训练周期从数月缩短到数天,算力成本也远低于从头联合预训练一个全模态模型。

这种架构选择放在产业语境里看,意味着Deepslate不必在每一代基础模型升级时推倒重来。它可以把资源集中在欧洲语言的后训练和音频前后端优化上,而不是与拥有万卡集群的美国实验室比拼预训练规模。但这也引出一个待验证的问题:开放权重语言模型本身的推理能力上限,会在多大程度上制约语音交互的复杂任务表现。公司尚未披露其当前使用的底层模型来源与参数规模。

440毫秒的基准成绩,能否转化为采购理由

延迟是语音交互体验的核心变量。据公司披露,Deepslate的模型在Artificial Analysis独立基准中录得440毫秒响应时间,为截至2026年9月该基准测得最快的语音到语音模型;公司另称模型在用户说完话后250毫秒即可产生响应。在CoVoST2基准的欧洲语言比较中,公司称其取得了最佳错误率。这些数字构成了本轮融资叙事中最具传播力的部分。

需要明确的是,这些口径来自公司披露,尚无独立第三方对全部指标进行复核。Artificial Analysis的测量方法公开可查,但“最快”的表述本身带有时间戳——它描述的是2026年9月这个时点的排名,而非一个可以长期持有的技术壁垒。语音AI领域的基准迭代速度极快,美国竞争对手在实时语音上的投入规模远超一家种子轮公司,领先窗口可能以月而非年计。

更值得关注的是延迟之外的指标组合。一个能在440毫秒内开始说话的模型,如果在德语街道名、人名和方言上错误率过高,对保险理赔和银行客服场景就没有实际价值。Deepslate把资金用途中的一项明确指向“扩展欧洲训练数据,重点为德语街道名、人名与方言”,说明公司自己清楚,基准领先只是入场券,语言覆盖的深度才是欧洲市场的护城河。从已披露的信息看,公司尚未公布客户名称,也未披露生产环境中的错误率、客户留存或通话量数据,因此其“已被保险公司、联络中心与平台用于生产环境”的说法目前只能作为公司口径对待。

每分钟2欧分,价格战还是成本结构优势

据来源称,Deepslate通过自助平台和API提供模型,定价最高约每分钟通话2欧分;作为对比,可比的美国实时模型价格约为每分钟6至15美分。如果这一价格口径准确,Deepslate的定价仅为美国竞品的七分之一到三分之一。这种价差的来源值得拆解:一方面,端到端架构省去了语音识别、文本生成、语音合成三套系统的叠加成本;另一方面,开放权重语言模型的后训练路线避免了从零预训练的天量算力支出。

但价格优势需要放在商业模式里理解。Deepslate面向平台提供商和企业客户提供按量与自托管两种选项。自托管模式下,客户在自己的基础设施内运行模型,甚至可以选择气隙部署,完全不与外界连接。据来源称,公司托管于德国Telekom Cloud,并持有ISO 27001认证。这意味着Deepslate的收入结构可能同时包含API调用费和自托管授权费,后者在定价逻辑上更接近企业软件而非纯用量计费。公司未披露两类收入的比例,也未披露当前付费客户数量或合同金额,商业模式的验证程度仍不透明。

从产业链位置看,Deepslate的定价策略指向一个明确意图:用成本优势把语音AI从“按分钟计费的昂贵能力”变成“可以大规模部署的基础设施”。如果每分钟2欧分的价格能够覆盖推理成本并留下毛利,那么欧洲呼叫中心的高通话量场景就有了经济性前提。但这一前提是否成立,取决于模型在真实通话中的推理效率、自托管客户的硬件成本,以及公司是否在以亏损换早期客户。

欧洲语音AI的竞争格局,不在同一个牌桌上

来源称,语音AI市场主要由封装第三方模型API的平台与集成商构成,自研模型的公司较少。在欧洲,这一判断尤其成立。ElevenLabs虽然在语音合成领域有强品牌认知,但其核心能力与Deepslate的端到端语音到语音模型并不完全重叠;OpenAI、Google和xAI的实时语音产品则主要从美国云基础设施提供服务。Deepslate的竞争策略不是在同一维度上正面对抗,而是切入一个由监管约束划出的细分市场:数据必须留在欧洲、部署必须支持本地化、安全认证必须可验证。

42CAP的General Partner Julian von Fischer在投资声明中称:“欧洲需要自己的语音模型,而Deepslate是这里少数几个训练自有语音到语音模型的团队之一。”Alstin Capital的Partner Andreas Schenk则表示,投资逻辑在于看到一个“全球竞争力的Voice AI Model Lab”,将建立“欧洲语音AI的核心解决方案”。这些是投资方声明,代表其投资判断,而非对市场格局的独立验证。

值得注意的竞争变量是开源模型的演进速度。如果开放权重语音模型在欧洲的可用性快速提升,Deepslate的“自研模型”叙事可能面临来自开源社区和更大规模玩家的双重挤压。公司架构中“可替换语言模型”的设计,某种程度上承认了底层能力并非独家资产,其真正的差异化必须建立在欧洲语言数据、部署灵活性和监管适配的复合能力上,而非单一模型性能。

770万欧元能买到什么,买不到什么

种子轮770万欧元在AI模型训练的成本语境下是一个克制的数字。据投资方声明,创始团队“用一个小团队和大型实验室所需算力的一小部分”构建了当前模型。这笔新资金的使用方向包括:改进语音到语音模型、扩展欧洲训练数据、扩充销售与市场团队、在欧洲数据中心扩展生产基础设施,以及继续降低延迟和提升性能。从资金分配看,这是一张同时覆盖技术、数据和商业化的清单,但每一项的深度都受限于种子轮的体量。

训练数据是其中最具战略意义的部分。德语街道名、人名和方言的覆盖,不是从公开语料库简单抓取就能解决的问题,需要与行业场景深度绑定的数据采集和标注。公司未披露数据来源、数据规模或获取方式,也未说明如何处理欧洲各国在语音数据采集上的同意与隐私要求。如果这部分工作依赖人工标注或受监管行业的数据合作,770万欧元中的相当比例可能被数据工程消耗。

销售与市场团队的扩充同样值得审视。Deepslate的目标客户——保险公司、银行、医疗机构和政府——采购周期长、合规审查严、对供应商稳定性要求高。一家2024年成立的种子轮公司要进入这类机构的供应商名单,仅靠基准数据远远不够。公司称其技术已被保险公司、联络中心与平台用于生产环境,但未公开客户名称,这使得“生产环境使用”的深度和规模无法被外部评估。一个可能的推断是:早期客户更可能来自对数据主权有刚性需求的中型机构或平台提供商,而非大型银行或保险集团的核心系统。

数据主权的可验证性,是叙事还是产品

Deepslate联合创始人在接受采访时表示:“对我们的客户来说,数据主权不是可有可无的,而是前提条件。它要么可以被验证,要么就毫无价值。这就是为什么我们披露计算发生的地点、我们的子处理者是谁以及相关细节。”这段话把数据主权从营销概念推向了可验证的产品属性。

从已披露的信息看,Deepslate的验证链条包括:模型托管于德国Telekom Cloud、支持客户自托管与气隙部署、持有ISO 27001认证。这三项构成了一个可被采购方审查的基础框架。但“可验证”的深度仍有边界:公司未披露子处理者的完整名单、数据在推理过程中的留存策略、自托管模式下的更新与维护机制,以及ISO 27001认证的具体覆盖范围。对于受监管行业的合规团队而言,这些细节往往比“德国托管”四个字更重要。

数据主权的商业价值在欧洲语境下是真实的,但它能否转化为可持续的竞争壁垒,取决于一个关键问题:当美国竞争对手也开始提供欧洲区域部署时,Deepslate的差异化还剩多少。Google和OpenAI已经在欧洲建设或租用数据中心,ElevenLabs也在推进企业级部署选项。如果“欧洲托管”本身变得普遍,Deepslate需要证明的是更深层的东西——对欧洲语言细节的理解、对受监管行业工作流的适配,以及一个不被美国公司产品路线图左右的独立模型演进节奏。

风险不在技术,在时间窗口与验证路径

来源指出,仅靠延迟优势难以持久,本地部署、监管适配、语言覆盖、数据控制与更低运营成本可能比基准领先更重要。这一判断切中了Deepslate的核心风险。440毫秒的基准成绩是一个时点性数据,它证明了团队的技术能力,但不构成长期壁垒。真正的壁垒需要来自:客户在生产环境中积累的不可替代数据飞轮、受监管行业对独立欧洲供应商的制度性偏好,以及自托管模式带来的转换成本。

另一个待验证假设是“语音到语音”本身的市场需求强度。端到端模型省去文本中间层的技术优势,在需要精确记录、审计和合规留痕的场景中可能变成劣势。保险理赔和银行客服往往要求逐字记录对话内容,如果模型不经过文本层,审计链路如何建立?公司未披露其系统是否在端到端处理之外提供转录或日志能力。这个问题不解决,受监管行业的采用深度就会受限。

从资本结构看,本轮领投方42CAP是慕尼黑科技投资机构,Alstin Capital和SIVentures的参与表明德国本土投资生态对“欧洲数据主权+AI基础设施”叙事的认可。但种子轮770万欧元与语音AI领域美国公司动辄数千万美元的融资规模相比,意味着Deepslate必须在资源约束下做出取舍。公司选择把资金分散投向模型、数据、销售和基础设施,而不是集中押注单一维度,这降低了短期风险,也可能稀释了在任何单一维度上建立决定性优势的速度。

从已披露的架构选择、定价策略和部署模式看,Deepslate的推理链是清晰的:欧洲受监管行业存在数据主权刚需,现有美国产品无法完全满足,自研端到端模型在延迟和成本上具备结构优势,因此存在一个可防御的细分市场。但这条推理链的每一个环节都带着未经验证的前提:客户是否愿意为数据主权支付溢价、自托管模式的运维成本是否被市场接受、语言覆盖能否在有限资金下达到生产级标准。770万欧元买来的是一个验证这些前提的机会,而不是答案本身。

验证边界与可复核指标

本文涉及的“首个、唯一、最大、领先”、订单、出货、性能等表述,如无另行说明,均是公司、创始人或投资方在现有公开材料中的披露口径;RecodeX未在本次采集材料中找到独立审计或第三方测试结论,因而不将其视为已经独立确认的事实。文中的产业协同、竞争位置和商业路径属于基于已披露产品与融资用途的编辑分析,不代表相关结果已经实现。

  • 技术侧应核验第三方测试条件、样本规模、良率、稳定性及与可比方案一致口径的结果;
  • 商业侧应核验去重后的付费客户、可执行合同、收入确认、复购率以及订单转化;
  • 资本与产业协同应以工商股权、关联交易、联合开发、采购或量产文件为准。

RecodeX 极客视:Deepslate的故事本质上不是一家语音AI公司跑分的故事,而是一个关于“技术主权如何变成可采购产品”的实验。当美国实验室用算力堆出越来越快的实时语音模型时,这家柏林公司选择了一条更窄但更具体的路:把数据留在可验证的欧洲基础设施里,把价格压到每分钟2欧分,把德语方言和街道名当作核心训练目标。这条路能否走通,不取决于440毫秒的基准能否保持,而取决于欧洲受监管行业是否真的愿意为一个独立的语音模型供应商买单——以及这家种子轮公司能否在资金耗尽之前,把“生产环境使用”从一句未公开客户名称的公司口径,变成可核查的合同与收入。

信息来源

本文在采集与核验阶段引用了以下公开来源,按站点去重列出;来源内容归原发布方所有,其口径不代表 RecodeX 的核实结论。