推理账单先于模型能力崩溃

2026年7月,一个20人工程团队做了一次切换:从Claude迁移到GLM 5.2,托管在一家成立仅两年的剑桥初创公司的推理平台上。两个月后,这家公司披露,该团队的月度AI支出从4万美元降至6000美元。一次智能体轨迹运行了4571轮、完成9556次工具调用,其运行时记录4.49亿token,而常规运行时会计费26亿token。

这个案例的冲击力不在于省钱本身,而在于它指向一个正在固化的行业矛盾:模型能力已经足够支撑长时间编码任务,但推理成本让工程团队在扩大智能体使用和收紧预算之间反复摇摆。当一家公司把“省token”作为核心卖点时,它实际上是在赌一件事——模型供应商和开源框架的优化速度,追不上智能体任务复杂度的膨胀速度。

9月22日,这家名为Subconscious的公司宣布完成510万美元融资,覆盖种子前轮与种子轮。公司称其推理平台结合动态上下文压缩与缓存,可将长时间运行AI智能体的成本最多降低80%。这个数字来自公司自报,未经独立验证。但比数字更值得关注的是,这笔融资背后是一个更具体的商业判断:推理效率本身,正在成为可以单独定价的基础设施层。

Subconscious的切入时机建立在一个可观察的行业错配上。开放权重模型在编码任务上的能力已经接近或达到可用门槛,但工程团队在长时间智能体任务上的支出增长,超过了模型调用单价下降带来的缓解效果。这意味着,即使模型层继续降价,智能体任务轮次和上下文长度的膨胀仍可能推高总账单。Subconscious试图在这个错配中建立自己的位置:不参与模型能力竞争,只解决“能力已经够用但跑起来太贵”的问题。这一判断能否成立,取决于智能体任务复杂度是否真的会以超过底层优化速度的节奏增长,目前这仍是一个需要时间验证的假设。

字段 内容
公司 Subconscious
轮次 种子前轮及种子轮
金额 510万美元
投资方 Foothill Ventures、Underscore VC、E14 Fund、Oakseed Ventures、Agent Fund、Companyon Ventures、Taihill Venture
总部 剑桥(美国)
创始人 Jack O’Brien(联合创始人兼CEO)、Hongyin Luo(联合创始人兼CTO)
官网 未披露

把上下文压缩做成运行时,而不是模型特性

Subconscious的产品逻辑与模型层的优化路径不同。它不训练新模型,也不替换客户正在使用的智能体工具。公司称其运行时通过动态上下文压缩与缓存,减少智能体在长任务中反复处理的上下文量。这意味着它切入的是模型调用之外的一层:当智能体执行数千轮推理时,每一轮携带的历史信息都在累积token成本,而压缩的目标是让这些历史信息以更小的体积被重复使用。

据公司披露,对于超过20万token的工作负载,其平台可将任务速度提升一倍,模型有效上下文扩展至超过500万token,成本最多降低80%。这些均为公司报告的绩效声明,未经独立验证。公司称其运行时支持云端与本地部署,也可部署在客户自有GPU上,通过CLI可连接Claude Code、Codex、Pi、Copilot、OpenCode等工具。这一设计意味着Subconscious试图成为现有智能体工具链下方的兼容层,而非要求客户迁移到新的交互界面。

从技术路径看,Subconscious的差异化在于把上下文压缩从模型内部的注意力优化,外置为运行时层面的系统能力。这种做法的潜在优势是模型无关性——同一套压缩机制可以作用于不同开放权重模型。但这也构成一个待验证假设:压缩机制是否能在不同模型架构和不同任务类型上保持一致的节省效果,公告未提供跨模型、跨工作负载的泛化证据。

把压缩放在运行时层,还意味着Subconscious的工程迭代可以独立于模型发布周期进行。它不需要等待某个基础模型更新来改善上下文处理,而是可以在系统层持续调整压缩策略和缓存命中逻辑。这种独立性可能带来更快的迭代节奏,但也意味着它必须自己承担兼容性维护成本:每当客户切换模型或智能体框架,压缩机制都需要证明自己仍然有效。公司称其CLI可连接多种主流编码智能体工具,但公告未说明这些连接在不同工具版本和模型组合下的稳定性表现。对于一家以“不替换客户工具”为卖点的公司来说,兼容层的维护质量直接决定其能否留在客户的现有工作流中。

一个未具名客户撑起的最强商业证据

Subconscious在公告中给出的最强商业证据,是一个由公司转述的客户案例。该20人工程团队于2026年7月从Claude切换到其平台托管的GLM 5.2,月度AI支出从4万美元降至6000美元。公司称客户报告模型能力没有损失,但未披露客户名称,也未说明成本对比的计算方式。

编辑按公司披露的4.49亿对26亿token计算,削减幅度约为83%。该计算基于公司披露的token计量数据,假设两种运行时的计量口径一致,未经独立验证。这个案例的价值在于它展示了压缩技术在真实工作负载上的潜在节省规模,但其说服力受限于单一客户、未具名、无独立核算三重约束。对于一家试图向工程团队销售推理基础设施的公司来说,一个匿名案例可以说明可能性,但不足以建立可复制的商业证据链。

该案例同时揭示了Subconscious的目标买家画像:已经在编码智能体上产生重度支出的团队,希望在不重写应用、不增加硬件的前提下,把更多工作负载迁移到开放模型上。这类买家的存在本身并不令人意外,但Subconscious尚未证明这个画像的规模足以支撑其商业化节奏。

从客户案例中的4571轮轨迹和9556次工具调用来看,该团队的工作负载已经进入“长时程智能体”的典型区间:单次任务跨越数千轮推理,工具调用密集,上下文累积量巨大。这种负载形态下,压缩收益可能被放大,因为每一轮携带的历史上下文越长,压缩可削减的token量就越大。但反过来看,这也意味着Subconscious的早期证据高度依赖特定负载形态。对于轮次较短、上下文累积不明显的任务,压缩带来的节省可能显著缩小。公告未提供该客户在切换前后的任务量变化数据,因此无法判断4万美元到6000美元的下降中,有多少来自压缩本身,有多少可能来自使用模式调整或模型切换带来的单价差异。这一口径缺口使该案例的归因变得模糊。

基准测试里的两倍速,和它的口径边界

Subconscious提供了两组基准测试数据,试图将“更快、更省”从客户故事推进到可比较的技术声明。在TriE系统基准上,公司称其运行时比SGLang快一倍,并发请求处理量为其2.3倍。在DeepSWE长编码任务基准上,公司称托管模型解决46%问题、平均成本2.79美元,对比标准推理基础设施的44%与3.92美元。以上均为公司自报性能,未经独立验证。

这两组数据的口径需要被严格区分。TriE基准衡量的是系统层面的吞吐与并发能力,对比对象是SGLang这一开源推理框架。DeepSWE则衡量长编码任务上的问题解决率与单任务成本,对比对象是公司所称的“标准推理基础设施”。两者测试场景不同,不能直接相加或混读。

DeepSWE数据中的成本优势约为29%,与公司整体宣称的“最多降低80%”来自不同测试场景。80%来自未具名客户案例的token计量对比,29%来自DeepSWE基准测试。两者都指向成本下降,但幅度差异显著,说明压缩收益高度依赖工作负载特征。公告未描述完整测试设置,也未提供独立复现路径,因此这些结果应被理解为Subconscious自己的基准声明,而非行业公认的评测结论。

值得进一步拆解的是DeepSWE数据中问题解决率与成本的关系。46%对44%的解决率差异只有两个百分点,这意味着Subconscious的运行时在该基准上的主要优势不在“做得更好”,而在“做得更便宜”。如果客户的核心诉求是任务完成质量,两个百分点的差距可能不足以驱动迁移;但如果客户的核心约束是预算,29%的单任务成本下降则可能成为关键决策变量。这种“质量持平、成本下降”的定位,与公司整体叙事一致,但也意味着它的价值主张高度依赖客户对成本的敏感度。对于预算充裕、更看重任务成功率的团队,Subconscious的吸引力可能有限。公告未提供DeepSWE上失败案例的成本对比,因此无法判断压缩机制在任务失败时是否仍能产生节省,还是会因为错误路径的上下文累积而失效。

投资方名单里的信息差

本次融资的投资方名单存在来源间的明显差异。Runtimewire报道称,公告列出的参与方包括Foothill Ventures、Underscore VC、E14 Fund、Oakseed Ventures和Agent Fund,O’Brien的帖子还列出Companyon Ventures和Taihill Venture。Silicon Snark则报道称,两轮融资由MassVentures领投,并列出Foothill Ventures、Underscore VC、E14 Fund、Oakseed Ventures和Agent Fund为参与方。VCBacked与FundedIQ列出的投资方为Foothill Ventures、Underscore VC、E14 Fund、MassVentures。

关键的事实边界是:公司公告的投资方名单中未列出MassVentures。MassVentures出现在Silicon Snark的领投方表述和部分数据平台的投资方列表中,但未出现在Runtimewire转述的公司公告名单中。领投方信息以公司公告为准,MassVentures的角色在本次采集材料中无法确认。E14 Fund的参与背景本次采集材料未披露。

这种投资方名单的混乱本身就是一个信号。对于一家种子阶段的公司,投资方构成通常反映其技术来源和商业化路径的背书结构。Subconscious源于MIT推理优化研究,联合创始人Hongyin Luo在MIT电气工程与计算机科学系完成博士研究,2025年与O’Brien等人合著论文探讨超越传统上下文限制的推理扩展技术。但投资方名单的版本差异说明,市场对这笔交易的资本结构理解尚不统一,公司也未在公告中提供两轮融资的金额拆分或估值。

投资方名单的版本差异还可能指向一个更实际的问题:不同数据平台在抓取和整理融资信息时,可能混用了公司公告、创始人帖子和数据库记录。对于潜在客户和后续投资人来说,这种混乱增加了尽职调查的摩擦成本。一家以“降低推理摩擦”为核心卖点的公司,在资本信息披露上却制造了额外的信息摩擦,这本身构成一个值得注意的反差。公告未解释为何不同来源的投资方名单存在差异,也未说明是否存在后续追加投资或数据平台的信息滞后。在缺乏公司官方澄清的情况下,外部只能以Runtimewire转述的公告名单为基准,同时将MassVentures的角色标记为未确认。

510万美元要同时验证两条部署路径

Subconscious的资金用途指向一个双重任务:构建并销售面向长时间运行AI智能体的推理平台,同时支持云端与客户自运营部署路径。这两条路径的商业逻辑不同。云端部署对应的是按使用量付费的托管服务收入,客户自运营部署则更接近软件授权或基础设施销售,收入确认方式和销售周期都有差异。

510万美元的融资规模,对于一家需要在两条部署路径上同时投入的推理基础设施公司来说,意味着验证窗口相对有限。公司需要在这笔资金耗尽前,证明至少一条路径能产生可重复的收入,同时为另一条路径保留足够的工程资源。公告未披露公司现有收入规模、客户数量或合同结构,因此无法判断其商业化起点。

从已披露的客户案例和产品形态看,Subconscious的早期商业化重心更偏向云端托管服务。客户自运营部署选项的存在,更多是为了覆盖对数据驻留和算力控制有严格要求的组织。但这条路径的销售复杂度更高,对一家11—50人规模的公司来说,同时推进两条路径可能分散工程和销售资源。公司未披露两条路径的资源分配比例,这一边界使外部难以评估其执行优先级。

两条部署路径的并存还意味着Subconscious需要维护两套交付和运维能力。云端托管要求公司自己承担GPU资源调度、服务可用性和弹性伸缩的工程负担;客户自运营部署则要求公司提供足够清晰的部署文档、版本兼容性保证和故障排查支持。对于一家种子阶段公司来说,这两套能力的人才需求并不完全重叠。O’Brien在帖子中称公司已在融资和管理服务发布前运营超过一年半,这暗示其云端托管路径可能已有一定的工程积累,但公告未说明这一年半中积累了多少付费客户、收入规模如何,也未说明自运营部署路径是否已有实际客户在生产环境中使用。这些缺口使外部难以判断510万美元是否足以支撑两条路径并行推进到可验证的商业里程碑。

风险不在技术,在验证的独立性

Subconscious面临的核心风险可以归结为一点:所有支撑其商业叙事的关键数据——80%成本降低、两倍速、2.3倍并发、46%问题解决率、客户支出从4万美元降至6000美元——全部来自公司自己的测试和客户案例,未经独立验证。这不是说这些数据不真实,而是说它们尚未达到可以被潜在客户用作采购依据的验证等级。

压缩技术能否在多样化客户工作负载上普遍实现宣称的节省,是另一个待验证假设。单一客户案例中的83%token削减幅度,可能与该团队特定的任务类型、模型选择和上下文模式高度相关。公告未提供跨客户、跨任务类型的泛化数据,也未说明压缩机制在失败案例中的表现。对于一家以“省token”为核心价值主张的公司来说,压缩失效的场景和压缩生效的场景同样重要。

竞争格局方面,SGLang作为开源推理框架,其优化进度不受Subconscious控制。如果SGLang或其他开源框架在上下文管理上实现类似效率,Subconscious的差异化空间将被压缩。公司称其在TriE基准上比SGLang快一倍,但这一优势的可持续性取决于双方后续的迭代速度,而非一次测试结果。此外,模型供应商自身也在优化推理效率,如果开放权重模型在上下文处理上取得突破,运行时层面的压缩价值可能被部分吸收。

还有一个容易被忽视的风险维度:Subconscious的客户案例中,成本下降同时包含了模型切换(从Claude到GLM 5.2)和运行时切换两个变量。这意味着4万美元到6000美元的降幅中,有一部分可能来自模型本身的定价差异,而非压缩技术的贡献。公司称客户报告模型能力没有损失,但未提供切换前后在任务完成率、代码质量或开发效率上的可比数据。如果客户在切换后需要更多人工干预或重试来弥补模型能力差异,那么token账单的下降可能被人力成本或时间成本部分抵消。公告未披露这些隐性成本,因此该案例的净收益仍不明确。对于潜在客户来说,这个缺口会直接影响他们对“迁移到Subconscious能省多少钱”的预期可信度。

验证边界与可复核指标

本文涉及的“首个、唯一、最大、领先”、订单、出货、性能等表述,如无另行说明,均是公司、创始人或投资方在现有公开材料中的披露口径;RecodeX未在本次采集材料中找到独立审计或第三方测试结论,因而不将其视为已经独立确认的事实。文中的产业协同、竞争位置和商业路径属于基于已披露产品与融资用途的编辑分析,不代表相关结果已经实现。

  • 技术侧应核验第三方测试条件、样本规模、良率、稳定性及与可比方案一致口径的结果;
  • 商业侧应核验去重后的付费客户、可执行合同、收入确认、复购率以及订单转化;
  • 资本与产业协同应以工商股权、关联交易、联合开发、采购或量产文件为准。

RecodeX 极客视:Subconscious的真正赌注不是压缩技术本身,而是压缩收益能否在模型供应商和开源框架的优化追上之前,固化为一个独立的计费层。它选择切入运行时而非模型层,避开了与基础模型公司的直接竞争,但也把自己置于一个尴尬位置:如果压缩效果足够好,模型供应商有动力将其内建;如果不够好,客户没有理由为中间层付费。510万美元买到的验证窗口里,Subconscious需要回答的不是“能不能省token”,而是“省下的token能否变成客户愿意持续付费的独立价值”。

信息来源

本文在采集与核验阶段引用了以下公开来源,按站点去重列出;来源内容归原发布方所有,其口径不代表 RecodeX 的核实结论。