当整个 AI 行业还在用 Transformer 架构疯狂堆算力、烧数据、卷参数时,一场关于“后 Transformer 时代”的暗战已经悄然打响。这不仅仅是技术路线的分歧,更触及了一个根本性的经济问题:如果通往通用智能的路径必须依赖指数级增长的能源与资金,那么在物理极限和商业回报的双重挤压下,这条路的尽头会不会是一堵墙?
Pathway,一家成立五年的 AI 研究公司,正试图用一套完全不同的答案来破解这个困局。公司联合创始人兼 CEO Zuzanna Stamirowska 直言,行业已经撞上了一道“看不见的结构性高墙”——没有足够能源支撑现有轨迹,数据正在枯竭,而每次增量提升的成本都远超上一次。她的赌注是,约束不在输入端,而在架构本身。
这个赌注刚刚获得了新的筹码。Pathway 宣布完成新一轮融资,投后估值达到 5 亿美元,累计种子轮融资总额增至 3000 万美元。投资方包括 Id4 Ventures、TQ Ventures、Red Bridge Ventures、Kadmos Capital、WS Investment Co.,以及 Databricks 首席 AI 科学家 Jonathan Frankle 的个人投资。WS Investment Co. 是律所 Wilson Sonsini 的投资部门,Frankle 则是 MosaicML 的创始团队成员,该公司 2023 年被 Databricks 收购。融资结构中新老资本的组合,折射出一个信号:当主流赛道被超大额交易定义时,一小批精于技术的资本正在悄悄押注架构层的破局者。
| 字段 | 内容 |
|---|---|
| 公司 | Pathway |
| 轮次 | 种子轮(新一轮估值融资) |
| 金额 | 未披露(累计种子轮 3000 万美元) |
| 投资方 | Id4 Ventures、TQ Ventures、Red Bridge Ventures、Kadmos Capital、WS Investment Co.、Jonathan Frankle |
| 总部 | 存在冲突:美国纽约 / 加州 或 瑞士 Saint-Cergue |
| 创始人 | Zuzanna Stamirowska、Jan Chorowski、Claire Nouet、Adrian Kosowski |
| 官网 | https://pathway.com |
不是降本增效,而是从根本上拒绝 Transformer 的指数级成本陷阱
过去三年,主导 AI 竞赛的逻辑几乎只有一个:规模缩放。从更多 GPU、更大数据集、更高参数量的预训练,到更长的思维链推理,每一次性能跃升都意味着算力账单的同步暴涨。Pathway 的回应是另起炉灶,设计一套被称为 BDH 的“后 Transformer”架构。
Pathway 声称,BDH 的目标是将推理、记忆和适应性直接嵌入模型架构本身,而不是像当前主流方案那样依赖不断拓宽的上下文窗口或外部记忆系统。其技术路径借鉴了可持续状态、稀疏激活、局部交互和持续调整等概念,公司称之为“受生物学启发”的设计,但并未试图直接复刻大脑机制。
一个可供检验的量化锚点是 ARC-AGI-1 基准测试。该测试专门考察 AI 系统能否从少量示例中推断变换规则,并应用于未见过的输入。Pathway 公布的数据显示,其 1.5 亿参数的 BDH-CQ 模型在公开的 400 任务 ARC-AGI-1 评估集上取得了 29.5% 的 pass@2 成绩,单任务推理成本约 0.0007 美元——这一估算是基于每 GPU 小时 3 美元的 H200 成本假设,单任务平均占用约 0.85 秒 GPU 时间。
放在行业坐标里,这一数字的意义不在于绝对分值。一些体量更大的推理系统可以在 ARC 上拿到更高分,但它们的每次推理消耗的计算资源通常是数量级差异。Pathway 试图挑战的,是行业默认的那条“成本-精度帕累托前沿”:即要想获得更强的推理能力,就必须接受等比例的昂贵推理账单。如果 BDH 在小规模下表现出的效率优势能够在更大规模上保持,那么企业部署 AI 的经济账就需要彻底重算。这一假设,是此轮 5 亿美元估值的最核心支撑。
实时数据平台的先发优势,是 BDH 商业化验证的第一块跳板
Pathway 并非凭空闯入模型研发赛道。在公司公开推广 BDH 架构之前,其业务根基扎在另一个更务实的领域:流式数据处理。
公司自研的实时数据平台支持接入 300 余种数据源,为 AI 应用提供持续同步的动态数据视图,而非依赖定期重建的静态索引。这一技术栈已经交付给一批对信息时效性要求极高的客户,包括北约、法国邮政 La Poste 和 F1。在 2024 年巴黎奥运会期间,La Poste 使用 Pathway 的平台应对运营中断,这一案例被 TQ Ventures 联合创始合伙人 Schuster Tanger 在投资声明中特别提及。
这层基建背景与 BDH 的研究方向存在一种内在关联:现有平台产品解决的是“如何让 AI 系统与持续变化的外部数据保持同步”,而 BDH 要解决的是“如何让模型架构自身具备持续记忆和自适应能力”。两者的共同场景是:医疗诊断需要基于最新临床指南实时更新判断,金融风控需要对市场异动做出即时响应,企业级 Agent 需要在长时间运行的任务中保留状态并持续学习。这些场景的共同特征,是推理成本敏感、数据持续流动,且决策错误代价高昂。
但值得注意的是,目前没有任何公开材料证明 BDH 模型已经在这类客户场景中完成了生产级商业化部署。公司披露的客户名单指向的仍是其数据处理平台产品,而非模型服务。这一距离,恰恰是 Pathay 需要在这轮资金的支持下加速跨越的鸿沟。
Arc 基准之外:一场围绕推理效率与模型本质的路线之争
Pathway 的赌注并非没有对立面。过去两年,以 o1、o3 为代表的推理模型已经证明,通过增强测试时计算(即在推理阶段动态分配更多算力用于链式思考),Transformer 架构仍有巨大的性能潜力可挖。OpenAI 首席科学家 Jakub Pachocki 等人所倡导的逻辑是:将中间推理步骤序列化为文本,是解决复杂问题的可靠路径,即便这会带来高昂的推理成本。
Pathway 的技术叙事则试图切割一块不同的蛋糕。BDH 不依赖链式思维或外部工具,也不进行回溯搜索,就在公司内部使用的大约 25 万道高难度逻辑谜题上做到了 97.4% 的准确率——而主流推理模型在这些谜题上得分接近零。Pathway 的隐含主张是:并非所有推理任务都必须通过文本中间步骤来完成,某些类型的推理可以在模型的潜在空间内部更高效地处理。
这构成了一种分化:一方试图让当前架构通过更多的计算堆叠不断逼近更高级推理能力;另一方则试图从架构底层出发,让模型在处理特定类型的推理时,天然具有更低的计算门槛。需要注意的是,Pathway 公布的结果目前仅限于较小规模的模型和特定测试集,而 OpenAI 等公司的大模型已在更广泛的通用任务上展示了竞争力。这并非“谁对谁错”的零和博弈,而是两种完全不同效率哲学之间的平行实验。
编辑判断:Pathway 在逻辑谜题和 ARC-AGI-1 上的差异化表现,确实为其“后 Transformer 架构在某些推理负载上具有效率优势”的论点提供了初步实证。但若从实验室走向产业,最关键的问题不是与 GPT-5 争夺通用对话能力,而是能否在金融、医疗等领域找到那些 Transformer 路线成本过高、且 BDH 效率优势能够被客户感知到的具体工作负载。
新资本结构透露出的人才与技术野心
本轮的资本布局,揭示出 Pathay 在团队建设上的意图远比单纯购买 GPU 更复杂。
Databricks 首席 AI 科学家 Jonathan Frankle 以天使投资人身份参与本轮。Frankle 因“彩票假说”研究蜚声学界,加入 MosaicML 后推动了大模型高效训练技术,跟随该公司被 Databricks 收购后,现任首席 AI 科学家。他的加入,为 Pathay 的模型规模化部署路线提供了来自前沿工程领域的背书。
更为关键的人事动作是,曾任职 Google DeepMind 的 Adam Kurzrok 正式加入并担任首席产品官。Kurzrok 在 DeepMind 期间担任 Gemini 平台的产品经理,负责模型范围界定、评估、部署和生态系统策略。在 DeepMind 向 Google 核心产品线推进 AI 落地的过程中积累的经验,恰是 Pathay 目前最稀缺的能力:如何将一个非 Transformer 架构的模型,包装并交付给习惯使用主流框架的企业客户。
Pathway 还同步披露了顾问团队的完全名单。其中,Transformer 架构的联合作者、TensorFlow 共同作者 Łukasz Kaiser 继续担任研发顾问,他曾参与 OpenAI o1 和 o3 推理模型、GPT-4 和 GPT-5 的研发。NYU Tandon 计算机科学与工程系主任、计算理论专家 Keith Ross,以及法国经济学家 Jacques Attali 也位列顾问组中。
这些名字所映射的,是 Pathay 试图在技术方向、工程可行性与商业模式三者之间搭建桥梁的紧迫感。如果 BDH 只能在论文和基准测试中证明自己,这笔 5 亿美元估值的赌注就没有兑现的任何希望。
五亿美元估值的真实含义:一个需要紧迫求证的高阶假设
在不披露本轮具体融资额的情况下,以累计 3000 万美元种子轮融资换取 5 亿美元估值,这一数字在种子阶段创业公司中极为罕见。通常,种子轮融资数百至一千万美元、估值数千万至一两亿美元的区间更为常见。5 亿美元的种子估值,意味着投资方已经将该公司的价值与某些已完成 B 轮融资的 AI 公司放在了同一水平上。
这一估值所内置的假设,不是“Pathway 当前的收入规模”,也不是“BDH 已赢得某个关键客户”,而是“BDH 架构的效率优势能够在规模扩大后保持,并将演化为一个可以商业化的模型产品”。
支撑这一假设的当前证据包括:在公开的推理效率基准上表现出对 Transformer 的成本优势;拥有已获验证的实时数据平台作为客户入口;聚集了包括 Transformer 原作者、顶级模型产品经理在内的核心团队。然而,这些要素仍未连成闭环。Arc 基准上的成功可能无法泛化到企业客户的实际工作负载;BDH 在 1.5 亿参数下的表现不能自动证明在更大规模下依然稳定;目前的客户关系来自数据平台产品,尚未有任何证据表明同一批客户正在或即将使用 BDH 模型。
公司明确表示,融资将主要用于扩展计算容量,包括部署 NVIDIA GB300 系统,以训练更大规模的 BDH 模型,并拓展数学推理、ARC-AGI-2 和 ARC-AGI-3 等新基准,以及研发融合潜在推理的大型语言模型。这意味着,Pathway 的整个估值叙事,将在接下来几个月的更大规模训练结果中迎来第一次关键检验。
尚未解决的歧义:商业模型缺失、总部冲突与融资历史疑云
在比对了多份资料后,几处事实性冲突和关键信息缺失比估值本身更值得追问。
首先是总部所在地。PitchBook 和 Dealroom 分别将其列为瑞士 Saint-Cergue 和美国纽约市,而另有多篇报道将其描述为“加州公司”或“波兰裔创办的加州创业公司”。这种多总部身份的模糊性,可能影响客户对于其数据主权和合规性的判断,尤其是其客户名单中包括北约这类对数据管辖权高度敏感的机构。Pathway 官网和官方融资公告均未对此做出清晰声明。
其次是融资历史的不一致。PitchBook 显示 Pathay 累计融资额为 1440 万美元,而公司官方博客及 Unite.ai 报道均称累计种子轮已达 3000 万美元。这两组数据之间的高额差值,可能来源于 PitchBook 数据滞后、部分轮次未被追踪,或公司对“种子轮”的界定涵盖了多笔不同时间、不同形式的融资。公司未提供本轮具体的融资金额,使这一问题无法得到精确核实。若 3000 万美元属实,Pathay 的累计融资规模在种子期创业公司中处于高位,这与其 5 亿美元估值的风险画像相匹配。
第三,也是最关键的空白,是商业模型。来源材料中没有提及 Pathay 的定价策略、营收规模或客户合同结构。公司披露的客户——北约、La Poste、F1——指向的是其数据平台业务,而 BDH 模型尚未公布任何付费客户。Kurzrok 的就任暗示产品化正在加速,但投资者仍需回答:Pathay 是最终会以按 token 收费的模型 API 模式变现,还是以私有化部署的软件许可模式变现,抑或继续以垂直行业解决方案模式服务大客户?这三种路径所对应的收入结构、增长曲线和资本效率完全不同。
同样缺席的是竞争分析。Pathway 未明确指出其直接竞争对手。若将视野放宽,在“后 Transformer 架构探索”这个方向上,Mamba、RWKV 等状态空间模型已在推进,Liquid AI 等公司同样试图从动态系统理论出发重新设计模型架构。与它们相比,BDH 的技术差异和各自在特定基准上的优劣势,并未在公开材料中得到任何对比讨论。
这些歧义和空白的存在,意味着外部观察者尚无法对 Pathay 的长期竞争力做出完整判断。5 亿美元估值的叙事,目前更多建立在技术理念的差异性上,而非已验证的市场优势上。
RecodeX 极客视:架构赌注是 AI 投资中风险最高、回报周期最长的一种。当 Transformer 路线展现出惊人通用性,构建与之竞争的新架构需要的不仅是几项基准上的效率领先,更是一个能够说服客户放弃生态兼容性、迁移成本和人才惯性的完整价值主张。Pathway 的 BDH 模型在小规模实验中给出的成本曲线令人好奇,但我们需要看到它在更大规模上保持稳定,并找到那些 Transformer 成本确实高到不可接受的真实场景——否则,ARC 基准上再多几个百分点,也只是一篇好论文,而不是一家 5 亿美元的公司。
信息来源
本文在采集与核验阶段引用了以下公开来源,按站点去重列出;来源内容归原发布方所有,其口径不代表 RecodeX 的核实结论。
