本文信息来源:martinalderson
我不断听到有人将 AI 数据中心的繁荣与 2000 年代的电信业崩盘相提并论。这种相似之处似乎显而易见——数十亿美元的基础设施支出,对过度建设的担忧,以及迫在眉睫的泡沫预警。但是,当我真正仔细核算数据时,却发现其基本面截然不同。
我无意预测未来是否会发生崩盘或回调。我只想探讨的是,如果更详细地审视历史,这种与电信业的比较是否真的站得住脚。
电信业崩盘的真实经过
首先让我讲讲 2000 年代电信业崩盘实际上是什么样子的,因为细节至关重要。首先是巨额的资本支出——在 1995 到 2000 年间,用于铺设 8000 万到 9000 万英里光纤的资金约为 2 万亿美元 。经通胀调整后,这相当于超过 4 万亿美元,即按 2025 年美元计算,每年接近 1 万亿美元。
到 2002 年, 这些光纤中只有 2.7% 被使用 。
这种局面是如何造成的?除了许多公司涉及纯粹的证券欺诈外,还源于对供需关系的灾难性误判。电信公司的 CEO 们声称互联网流量每 3-4 个月就翻一番。
但实际上, 流量大约每 12 个月才翻一番 。这是对需求增长 4 倍的高估,而且这种误差每年都在复利累积。这种错误的假设驱动了大规模的举债过度建设。如果你连续 3 年每年都高估 4 倍,到最后你的预估将偏差 256 倍。
对这些公司来说更糟糕的是,随着光收发器技术取得了巨大突破,在接下来的十年里,同一根光纤传输的流量增加了 10 万倍。波分复用(WDM multiplexing)就是一个例子,它允许在同一条物理光纤线路上复用多个载波信号。1995 年,最先进的技术只有 4-8 个载波。到了 2000 年,这个数字变成了 128 个。仅此一项就在相同的基础设施上实现了 64 倍的容量增长。再加上调制技术、纠错能力的改进,以及每个载波每秒可处理比特数的提升,同一根物理光纤的能力呈指数级增长。
关键的动态在于:供应端的改进是指数级的,而需求端的增长仅仅是线性的。虽然建设某些物理基础设施是必要的,但当时出现了巨大的过度建设,而这些需求本可以通过对相同基础设施进行技术升级来满足。
AI 基础设施:一个截然不同的故事
与 20 世纪 90 年代的光纤不同,GPU 的每瓦性能提升实际上正在放缓:
2015-2020 年期间:
- 随着主要的架构变革,每瓦性能显著提升
- 制程工艺节点从约 20nm 跃升至 7nm(效率大幅提高)
- 引入 Tensor Core(张量核心)及专用 AI 硬件
2020-2025年期间:
- 机器学习(ML)硬件的能效每年提升约 40%
- 与前一个时期相比,每瓦性能的提升速度正在放缓
- 工艺节点:随着波长在 5 纳米以下必须使用极紫外光刻(EUV)技术,其改进速度已显著放缓。
更说明问题的是,GPU 的 TDP(即功耗)正在急剧上升 :
- V100 (2017):300W
- A100 (2020):400W
- H100 (2022):700W
- B200 (2024): 1000-1200W
这种情况与电信行业发生的情况截然相反。我们并没有看到那种让现有基础设施过时的指数级效率提升。相反,我们看到的是半导体物理学正在触及根本性的极限。
英伟达(NVidia)的 B200 还需要液冷技术——这意味着大多数为风冷设计的现有数据中心都需要进行彻底的改造。
需求增长实际上正在加速
电信泡沫破裂的部分原因是对需求的估计过高了 4 倍。那么,AI 需求的增长情况看起来如何呢?
传统 LLM 的使用:ChatGPT 平均每位用户每天的提示词(prompts)数量超过 20 个 。虽然扩展对话 cumulatively 可以达到 3,000-4,000 个 tokens,但许多用户把它当 Google 用——进行没有后续追问的简短“搜索”,这消耗的 tokens 少得惊人。
代理(Agent)的使用(Anthropic 研究 ):
- 基础代理: 比纯聊天多消耗 4 倍的 tokens
- 多智能体系统:Token 消耗量是聊天机器人的 **15 倍以上**
- 编程智能体:**每会话消耗 150,000+ Token**(每天多次会话)
我们面对的是一条根本不同的需求曲线——如果说有什么不同的话,那就是人们低估了智能体(Agents)将消耗多少算力。从聊天机器人向智能体的转变,意味着每位用户的 Token 消耗量将增加 10 到 100 倍。
我们甚至还没真正进入那个阶段,基础设施就已经到了极限,AI 基础设施正以极高的利用率运行。主要服务提供商在高峰时段仍然面临容量问题。问题并不是闲置的基础设施无人使用;而是现有的基础设施难以满足当下的需求。一家主要的超大规模云服务商告诉我,他们在高峰时段 仍然 存在容量问题,导致免费层级用户的报错率居高不下。
数据中心资本支出:是演变,而非革命
还有一个常被忽视的重要背景信息:
AI 爆发前的增长(2018-2021 年):
- 亚马逊、微软和谷歌的总资本支出:680 亿美元 (2018 年) → 1240 亿美元 (2021 年)
- 3年增长81%
- 年增长率:~22%
- 受云迁移、疫情加速效应及流媒体发展的推动
AI 爆发期(2023-2025):
- 2023年:1270亿美元
- 2024 年:2120 亿美元 (同比增长 67%)
- 2025 年预计:2550 亿美元以上 (亚马逊 1000 亿美元,微软 800 亿美元,Alphabet 750 亿美元)
虽然这无疑是一笔投入巨大的资本支出(Capex),但并没有某些新闻报道渲染得那么夸张。我毫不怀疑,现在任何与数据中心相关的资本支出都被重新包装成了“人工智能”项目,即便只是那些通常不直接用于人工智能的“枯燥”的老式计算、存储和网络设施。
为什么预测几乎是不可能的
我认为,正是在这一点上,将其与电信行业的对比变得既有趣又令人担忧。
交付周期的问题:
- 数据中心建设需要2-3年时间
- GPU 订单的交付周期为 6-12 个月
- 无法根据需求实时调整产能
囚徒困境:
- 低估需求 = 糟糕的用户体验 + 输给竞争对手
- 高估需求 = 数十亿资本支出的浪费(这些资源可能只是被使用得慢一点而已)
- 若有的选,理性的参与者都会选择过度建设——因为浪费一些资本支出总比输掉“AI 战争”要好上无数倍
预测挑战:
设想你现在正在规划 2027 年的数据中心容量。你必须在今天做出数以十亿美元计的决策,而这完全取决于你如何预判三年后的 AI 使用情况。
情景一:智能体(Agent)的普及是循序渐进的。部分开发人员每天使用 Claude Code。少数企业部署了内部智能体。客户服务主要仍由人工完成,辅以 AI 协助。这种情况下,你大概需要当前基础设施规模的 3-4 倍。
情景二:智能体成为主流。每位开发人员都拥有一个全天候运行的编码智能体,每次会话消耗数百万个 token。企业在运营、财务、法务和销售部门全面部署智能体。客户服务 80% 转为智能体接手,人工仅处理升级投诉。这种情况下,你需要当前基础设施规模的 30-50 倍。
这两种情景都完全在情理之中。没人能确切地告诉你哪一种是对的。但你现在必须投入数十亿美元的资本支出(capex)——数据中心需要 2-3 年才能建成,GPU 订单的交货周期也长达 6-12 个月。
但这里有一个真正阴险的地方: 即使你的大方向是对的,微小的误差也会像滚雪球一样变得巨大。假设你确信智能体(agents)将成为主流,并且你需要能在 3 年内达到大约 50 倍增长的规模。
如果实际需求是 40 倍,你就过度建设了 25%——意味着数十亿的过剩产能。如果实际需求是 60 倍,你就少建了 20%——导致你的服务质量下降并因此失去市场份额。
你正试图在黑暗中击中一个移动的目标,而误差幅度是以数百亿美元的资金和数千兆瓦的电力基础设施来衡量的。
如果你针对第一种情景进行构建,结果却发生了第二种情景,你的服务质量会退化到无法使用的地步,引发用户抗议,并在 AI 战争中输给那些下注更大的竞争对手。如果你针对第二种情景进行构建,结果却发生了第一种情景,你将坐拥数十亿美元未被充分利用的数据中心,只能看着资金白白燃烧。
你宁愿犯哪种错误?
这就是电信行业的类比最有意义的地方:面对这些选择,理性的参与者会选择过度建设。不同之处在于过剩产能的最终去向。
关键区别
让我用一张表来说明:
| 因素 | 电信行业(1990年代-2000年代) | AI 数据中心(2020 年代) |
|---|---|---|
| 供应改善 | 指数级(容量增加 100,000 倍) | 放缓(每瓦性能的年增长率从 69% 降至 44%) |
| 需求增长 | 高估了4倍 | 可能被低估(特别是考虑到智能体转型) |
| 利用率 | 95%的暗光纤(真正的产能过剩) | 非常高——许多供应商仍面临高峰时段的扩容问题 |
| 技术曲线 | 基础设施陈旧淘汰 | 触及半导体物理极限 |
| 功耗 | 下降 | 上升(300瓦 → 1200瓦) |
| 基础设施寿命 | 数十年(光纤不会发生退化) | 数年(随硬件升级而更新) |
电信业的崩盘之所以发生,是因为指数级增长的供应能力遇上了仅呈线性增长(且被高估)的需求,导致原本设计使用寿命长达数十年的基础设施闲置无用。
AI 数据中心正面临着供应改善放缓与需求呈潜在指数级增长之间的矛盾。而且关键在于,由于 GPU 效率提升的速度正在减慢,当今的硬件比前几代产品保值的时间不是变短了,而是变长了。
短期会出现回调吗?
短期内依然可能发生崩盘吗?当然有可能。
可能引发修正的场景:
1. 智能体(Agent)的应用遭遇瓶颈
企业可能会发现,在该署生产级智能体时,难度远超演示视频所展示的水平。在高风险工作流程中出现的幻觉问题、围绕自主 AI 系统的监管担忧,或是实施过程的复杂性,都可能极大地延缓其普及速度。如果智能体的全面普及需要 5-7 年而非预期的 2-3 年,那么就会出现一个痛苦的空窗期,届时价值数十亿美元的基础设施将闲置等待需求的跟进。
然而,鉴于软件工程及其他任务中 AI 使用量的爆炸式增长,我怀疑这种情况发生的可能性极低。你已经可以在专业服务中利用 Claude Code 处理非工程类任务 ,且无需任何行业特定的修改就能获得非常令人印象深刻的结果,因此我深信智能体将在各类领域获得极高的采用率。
2. 金融工程的崩塌
这些数据中心的扩建严重依赖债务融资。如果信贷市场停滞、利率进一步飙升,或者贷款人对 AI 的增长预期失去信心,这种融资模式可能会崩溃。这并不是技术基本面的问题,而是传统又老套的金融恐慌,类似于电信行业债务市场冻结时发生的情况。但有一个关键区别——许多关键参与者(Microsoft、Google、Meta、Oracle)拥有极其充裕的正向现金流,而这在 2000 年代的光纤繁荣时期绝对是不存在的。不过,纯粹的数据中心厂商确实面临风险——他们没有像“印钞机”一样的主营业务来为融资提供兜底,这一点毫无疑问。
3. 效率突破改变了计算逻辑
模型效率的提升速度可能超出预期。或者我们可能会看到硬件方面的突破:针对推理工作负载的定制 ASIC(专用集成电路)比 GB200 的效率高出 10 倍。这两种情况中的任何一种,都可能让当前的扩建显得过剩。实际上,我认为这是最大的风险——而且这正是光纤繁荣时期发生过的事情。不过到目前为止,我还没有看到这种迹象。虽说专用的 ASIC 正陆续面世,但它们之所以能达到惊人的速度,主要是靠巨大的晶圆尺寸,这(目前)还算不上是巨大的效率变革。
与电信业的关键区别:
即使市场出现回调,其背后的动态也截然不同。电信行业当年的建设是基于被高估了4倍的需求,随后眼看着光纤技术的进步让他们的基础设施未及使用便已过时。结果就是:95%的光纤永久处于“暗光纤”(闲置)状态。
AI 数据中心面临的情况可能有所不同。如果我们按 50 倍的增长预期进行建设,而 3 年内仅实现了 30 倍的增长,这并不算是“暗基础设施”——这只是意味着基础设施被利用的进度比预期慢了一些而已。与埋在地下闲置的光纤电缆不同,GPU 集群依然在为生产工作负载提供服务,只是产能利用率低于最初的计划罢了。
此外,不同于电信业因技术的指数级进步而使旧基础设施变得一文不值,GPU 效率的提升正在放缓。今天部署的 GB200 不会因为明年新芯片的到来而过时——因为新芯片只是略有改进,而不是好上 100 倍。随着工艺节点提升速度的放缓,当前一代硬件的保值时间实际上会更长。
所谓的市场修正,可能意味着在需求追赶产能的过冲中,我们将面临两到三年的财务阵痛、行业整合及资产减记。但这与为注定无法实现的需求建设基础设施、却在技术迭代中沦为废墟的情况,有着本质的区别。
真正的风险:在于时机,而非方向
我认为真正的问题不在于我们是否需要大规模的 AI 基础设施——单是向智能体(Agent)转型的趋势就表明我们确实需要。真正的问题在于时机。
如果企业需要用 5 年而不是 2 年才能大规模采用智能体,而超大规模云厂商(Hyperscalers)却是按照 2 年的预期来进行建设的,那么我们可能会看到长达 2 到 3 年的产能过剩和财务阵痛期。这足以引发市场回调、裁员和行业整合。
但与电信行业不同的是,这些过剩的产能很最终可能会被消化。
电信光纤之所以在当时大多处于闲置状态(暗光纤),是因为技术发展超越了它,且需求从未真正兑现。而 AI 基础设施可能只是来得早了点,方向并没有错。
结论
AI 数据中心是否正在重演电信泡沫崩盘的覆辙?基本面表明并非如此,但这并不意味着前路坦途、毫无波折。
人们在进行电信业类比时忽略了一个关键洞察:电信业当年是在“指数级的供应提升”遭遇“线性的需求增长”,且伴随着被高估了 4 倍的增长假设。而 AI 面临的是供应提升速度放缓,却可能遭遇因智能体(Agent)转型带来的“指数级需求增长”。
风险并不相同:
- 电信业: 过度建设了大量基础设施,结果因为供给侧的技术进步,这些设施变得彻底过时。
- 人工智能: 可能建设得太快太多,而需求的增长速度却比预期要慢。
但人工智能领域的“太多”,更像是“储备了可以使用三年的量,而不是原本的一年”,而并非“95% 将永远不会被使用”。
我也可能错了。也许智能体的普及会停滞,也许模型的效率提升会让现有基础设施过时,也许 GPU 架构会出现颠覆性的突破。但当我审视这些数据时,我并没有看到与电信业崩盘时相同的局面。
基本面是不同的。这并不意味着不会出现痛苦、整合或失败。但将目前的情况与2000年代的电信业相提并论,似乎是一种错误的心智模型,无法解释正在发生的实际情况。