深度文章
2026.09.08 12:12 约 21 分钟 商业洞察深度学习 新发布

Clouded Judgement 9.4.26 — Recurrent Depth

Altimeter 合伙人 Jamin Ball 解读传闻中 OpenAI Astra 采用的 recurrent depth(循环深度)架构:让 token 多次穿过同一块层,在参数与记忆不变下获得约 2 倍有效深度,并可能把部分推理移入隐藏计算。文章还回顾历次架构跃迁、讨论思维链可监测性争议,并附本周 SaaS 估值倍数与运营指标更新。

RECODEX · 深度文章 商业洞察
SandHill.io #300 推荐阅读 · 行业动态与分析 · 中文编译

作者 Jamin Ball · Altimeter Capital · 阅读英文原文 ↗ · 约 2,568 字 · 阅读约 6 分钟

导读Altimeter 合伙人 Jamin Ball 解读传闻中 OpenAI Astra 采用的 recurrent depth(循环深度)架构:让 token 多次穿过同一块层,在参数与记忆不变下获得约 2 倍有效深度,并可能把部分推理移入隐藏计算。文章还回顾历次架构跃迁、讨论思维链可监测性争议,并附本周 SaaS 估值倍数与运营指标更新。

要点

  1. recurrent depth 让 token 多次穿过同一块层:参数与记忆保持平坦而算力翻倍,再通过的甜点约为 ~2
  2. 记忆是推理的真实约束,循环架构可在不增加记忆下获得 2x 有效深度,并可能减少所需 reasoning tokens
  3. 作者认为这更像温和的架构微调而非突破,类比 Snowflake 分离 compute 与 storage
  4. The Information 称该技术可能模糊思维链;Jakub Pachocki 回应 Astra 计算图深度约为 GPT-4 的 ~2x,隐藏计算量无实质变化
  5. 本周 SaaS 整体 EV/NTM 收入倍数中位数 4.4x,高增长桶 18.1x,NTM 增长中位数 13%,10Y 为 4.8%
每周我会更新云软件公司的最新趋势。跟着读,保持同步。

Recurrent Depth

本周我们窥见了 OpenAI 的新模型 Astra。我觉得它重要,因为传闻它使用一种叫 recurrent depth(循环深度) 的新技术。本文想讨论那意味着什么、以及影响是什么。但先快速回顾一些更大的模型架构突破时间线:

  • 2017:Transformer 时代。 跃迁是 self-attention(自注意力)机制。2017 年前,循环神经网络(RNN)逐词处理文本。如今著名的论文 Attention Is All You Need 引入 Transformer 架构,使并行训练成为可能。
  • 2018–2020:Decoder-Only 架构。 跃迁是自回归缩放与 in-context learning(上下文学习)。早期 Transformer 用 encoder-decoder 设置(如 BERT)。OpenAI 翻转这一点:缩放 decoder-only 模型(GPT-1 到 GPT-3)。该技术的结果是:仅通过预测下一个 token(在数十亿参数上缩放时),自然涌现出上下文学习等能力。
  • 2023:稀疏 Mixture-of-Experts(MoE)。 跃迁是条件路由。教训是:随着模型参数量越来越大,对每个 token 激活每一个参数在经济上不可行。于是不再对每个 token 激活全部参数;模型把 token 路由到「专家」子网络/参数的专门网络。这使巨大模型(与巨大智能)只对较小子集跑算力(即让巨大模型的成本更像较小模型)。

Kimi K3 有 2.8T 总参数,但只有约 2% 「激活」。一些更大模型(如 DeepSeek V4)有类似的低/中个位数稀疏比。这些稀疏模型与稠密模型形成对照——如 Gemma 27B,对每个 token 激活全部 27B 参数。

  • 2024:Test-Time Compute / Chain-of-Thought / Reasoning。 跃迁是显式推理时缩放与「思考模型」。这是旗舰 OpenAI o1(以及 o 系列)模型。OpenAI 引入在推理时而非仅在训练时缩放算力。
  • 2026:Recurrent Depth / Looped Transformers。 这会是下一次跃迁吗??潜在跃迁(我们会讨论)是隐式 latent space reasoning(潜空间推理)。让我们更深入这种新架构!

先声明——据我所知,Astra 模型系列使用 Recurrent Depth 仍属「传闻」(The Information 的出色报道!)。我不认为 OpenAI 已确认任何事。但挖一挖这项新技术意味着什么仍然有趣!

过去几天我对 recurrent depth 做了很多研究(所以我绝非专家),能给出的最简描述是这样。Transformer 架构由一层层堆叠构成,一个 token 会穿过每一层一次。在每一层,模型会看这个 token 及其周围的一切,然后把理解再 refining(精炼)一点。所以当 token 离开最后一层时,它已经过许多轮(即许多层)精炼。

说得更复杂一点:每一层取 token 当前的数学表示(向量里的一大串数字),看周围的 token,然后稍微 tweaks(微调)表示(即那些数字)。这在每一层反复发生,直到它从最后一层出来时被充分精炼。

在 recurrent depth(或「looped transformers」)架构中变化的是:token 会多次穿过同一块层。换句话说,token 不只是被每一层精炼一次,而是被多层多次精炼。这会改变模型的轨迹。在此架构之前,构建更强模型的常规方式就是加更多层(或把单层做宽)。增加更多精炼时段(或让精炼时段更细致)。

想象脏水穿过许多层纸滤:你加的纸滤越多,末端出来的水越干净。水一次只穿一层。循环方法不必加更多纸滤层——它可以只跑较少滤层,但一遍又一遍。完成这个类比:像把水放进水车,让它绕着同一滤器多次跑。

我试着给一个稍偏技术的解释。Transformer 里的 depth 通常被描述为层数,每层有自己的权重。用「旧」方式缩放 depth——参数、记忆与算力同升同降。对比之下,当你循环时,参数与记忆可以保持平坦,但算力翻倍(若同一块层过两遍;过三遍则三倍,等等)。公开研究还不多(目前),但按我的理解,再通过的甜点大约是 ~2

有一篇很酷的研究论文 Mixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Level Computation,加入一个较小的「learned router」,按 token 决定跑多少圈循环。更基础的计算可能只过一层一次;复杂度上升,循环数上升。「token 级自适应算力」是另一种说法。

那这为什么重要?我能想到几条。

  1. 记忆目前是推理的真实约束。有了 recurrent depth / loops,模型可以在不需要更多记忆的情况下获得 2x 有效深度(如上所述:你不必把参数/记忆/算力一起缩放,可以分开做以驱动类似结果)。
  2. 它也可能把一部分思考从输出 token 移进看起来更像隐藏计算的东西。若模型能在吐出输出 token、再迭代输出之前,在模型层「内部」做更多工作,它可能需要更少的 reasoning tokens 才能到达同一输出。这对以 input / output token 计价的模型开始有意义。我们会需要新的第三维计价吗?input / output / internal tokens?

然后还有一种完全不同的 takeaway:这一切其实没那么大不了……很多人说这项突破其实没那么突破,也不能把 Astra 的全部性能增益都归因于 recurrent depth 架构。我前面引用的那篇论文一年多前就写了。这不是全新的东西。Reasoning / chain of thought 感觉像大事。Recurrent depth / loops 感觉更像一次温和的架构微调。它未必训练或运行更快。

我的天真快速 takeaway 是——这次架构微调是否类似于 Snowflake 分离 compute / storage?在 Snowflake 之前,Redshift 强迫你把 storage / compute 一起缩放。

最后回扣 The Information 那篇文章,以及他们提出的一点。文章讨论这项新技术实际上可能模糊模型的 reasoning / chain of thought。含义是:思维链是窥探模型如何工作的最佳「引擎盖下视角」,而使其更不透明可能让模型更难审计。随之而来是新的安全/控制问题。

这获得了足够多关注,以至于 Jakub Pachocki(OpenAI 首席科学家)作出评论。概括(全文推文有链接):他说 Astra 计算图的深度大约是 GPT-4 的 ~2x,因此每个 token 发生多少隐藏计算其实没什么变化。他也略微反驳 The Information 的初始主张,称 chain-of-thought monitoring 反正也不像人们想的那么有用。

Sam Altman 昨天也上了 Bloomberg,由 Ed Ludlow 采访,被问到模型可观测性。我当时在看直播,所以这段引语更像对 Sam 回应的转述:

我们谈可监测性(monitorability)的重要性已经很久了……我们也相信 defense in depth(纵深防御)……有沙箱、对齐,以及许多合在一起让模型安全的东西……可监测性是我们谈了很久的重要事项,思维链监测的重要性……我们做了很多决定来保留思维链可观测性。这很重要。我也想说清楚:它不是唯一重要的事。


Jakub Pachocki (@merettm)
I want to prevent a race into unmonitorability kicked off by confused reporting. The depth of the computation graph for our present frontier models, including Astra, is within a factor of two of GPT-4. OpenAI has worked to preserve and utilize chain-of-thought monitoring since…
5:37 AM · Sep 2, 2026 · 1.39M Views

季度报告摘要

季度报告摘要

Top 10 EV / NTM Revenue Multiples

Top 10 EV / NTM Revenue Multiples

Top 10 Weekly Share Price Movement

Top 10 Weekly Share Price Movement

倍数更新

SaaS 业务通常按收入倍数估值——多数情况下是未来 12 个月的预期收入。收入倍数是速记估值框架。鉴于多数软件公司尚未盈利,或未产生有意义的 FCF(自由现金流),它是对比整个行业的唯一指标。即便 DCF 也充满长期假设。SaaS 的承诺是:早年增长带来成熟年利润。下方倍数按 Enterprise Value(市值 + 债务 − 现金)/ NTM 收入计算。

整体倍数概览

整体统计:

  • Overall Median:4.4x
  • Top 5 Median:31.0x
  • 10Y:4.8%
倍数分布

按增长分桶。在下方分桶中,我把高增长定义为预计 NTM 增长 >22%,中增长 15%–22%,低增长 <15%。我不得不调整「高增长」的截止线。若 22% 感觉有点武断——因为它确实是……我只是挑了一个约有 ~10 家公司落入高增长桶的截止线,使样本量更有统计意义。

  • High Growth Median:18.1x
  • Mid Growth Median:6.7x
  • Low Growth Median:3.9x
按增长分桶的倍数

EV / NTM Rev / NTM Growth

下图展示 EV / NTM 收入倍数除以 NTM 一致预期增长。因此一家以 20x NTM 收入交易、预计增长 100% 的公司,会以 0.2x 交易。该图目标是显示相对其增长预期,每只股票相对有多便宜/昂贵。

EV / NTM Rev / NTM Growth
EV / NTM Rev / Growth 续
相关散点/明细

EV / NTM FCF

折线图显示所有 FCF 倍数 >0x 且 <100x 公司的中位数。我创建这个子集,是为展示 FCF 作为相关估值指标的公司。

EV / NTM FCF 中位数

NTM FCF 为负的公司未列在图上。

EV / NTM FCF 明细

EV / NTM Rev Multiple vs NTM Rev Growth 散点图

增长与估值倍数相关性有多高?

增长与估值倍数散点图

运营指标

  • Median NTM growth rate:13%
  • Median LTM growth rate:16%
  • Median Gross Margin:76%
  • Median Operating Margin:4%
  • Median FCF Margin:21%
  • Median Net Retention:110%
  • Median CAC Payback:31 months
  • Median S&M % Revenue:34%
  • Median R&D % Revenue:22%
  • Median G&A % Revenue:13%

Comps Output

Rule of 40 显示收入增长 + FCF margin(增长与利润率均有 LTM 与 NTM)。FCF 按经营活动现金流 − 资本支出计算。

GM Adjusted Payback 计算为:(上季 S&M)/(当季净新增 ARR × Gross Margin)× 12。它显示 SaaS 业务在毛利基础上收回 fully burdened CAC 需要多少个月。多数上市公司不披露净新增 ARR,因此我取隐含 ARR 指标(季度订阅收入 × 4)。净新增 ARR 就是当季 ARR 减上季 ARR。未披露订阅收入的公司已排除分析并列作 NA。

Comps Output 表一
Comps Output 表二

本文所用来源包括 Bloomberg、Pitchbook 与公司文件。

本文所呈信息为作者观点,不一定反映任何其他个人或实体的观点,包括 Altimeter Capital Management, LP(「Altimeter」)。所提供信息据信来自可靠来源,但对任何不准确不承担责任。本文仅供信息用途,不应被理解为投资建议。过往表现不保证未来表现。Altimeter 是在美国证券交易委员会注册的投资顾问。注册并不意味着某种技能或训练水平。

Altimeter 及其客户交易公开证券,并已做出和/或可能做出与本文提及公司相关的投资或投资决策。此处表达的观点属于作者,而非 Altimeter 或其客户;后者保留做出可被理解为与此处观点一致和/或不一致的投资决策或交易活动的权利。

本文及所呈信息仅供信息用途。此处观点仅为作者个人,不构成出售要约、购买建议,或购买任何证券的要约征求,亦不构成对任何投资产品或服务的推荐。虽本文部分信息据信来自可靠来源,作者及其雇主或其关联方均未独立核实,准确与完整无法保证。因此,不对信息的公平性、准确性、及时性或完整性作任何明示或暗示的陈述或保证,也不应依赖。作者及所有雇主与其关联人士对本信息不承担责任,亦无义务更新本文所含信息或分析。

英文原题 Clouded Judgement 9.4.26 – Recurrent Depth
作者 Jamin Ball · Altimeter Capital
来源 SandHill.io #300 推荐阅读 · 行业动态与分析
编译 RecodeX Research · 2026 年 9 月 · 系列全部 28 篇见标签 SandHill.io

本文为英文原文的中文编译,版权归原作者与所属机构所有;译文仅供学习与研究交流,不构成投资建议。如原作者或权利方对转载有异议,请联系 will@recodex.ai,我们将及时处理。

订阅 RecodeX 创投情报 每日融资动态与原创深度报道,直达邮箱

了解 RecodeX 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读