数据中心产业化入门指南:AI 基础设施是下一项重要的产业能力
摘要
人工智能技术的发展并没有带来新的基础设施问题,反而暴露了原本就存在的那些问题。二十年来,数据中心一直被当作房地产项目来经营,但当 GPU 时代的需求出现时,其规模和复杂性已超出了原有运营模式所能应对的范围。电力网络无法快速实现各数据中心的互联,建筑行业也没有足够的人力来建造这些数据中心,电力供应链也无法按时交付所需的组件,而除了那些大型科技企业之外,还不存在能够让这些数据中心高效运行的软件。此外,用于处理这类硬件处置业务的体系也并非为那些需要每隔几年就更换一次的硬件而设计的。这些都不是技术层面的问题,而是整个行业在扩大发展规模的同时未能同步完善其运营基础设施所导致的累积后果。我们正在着力弥补的,正是这种差距。
世界正在像消耗电力一样消耗智能资源,而支撑这种消耗所需的基础设施则代表着巨大的商业机遇。
即将到来的十年里最具决定性意义的技术——人工智能,其发展方式与其他关键基础设施如铁路、电信和能源行业的历史发展模式类似:需要数百亿的资金投入,关键组件的研发周期很长,同时还面临能源供应的限制。这些未来的“工厂”同样存在各种现实层面的瓶颈。
计算智能正逐渐成为一种关键的工业资源,而与它相关的所有环节——选址、构建、供电、散热、持续运行以及退役处理——都与我们此前研究过的其他各类工业生命周期有着相似之处。
人工智能已经让数据中心从那些默默无闻、处于幕后、仅承担成本功能的场所,转变为推动人工智能发展的重要基础设施。十年前还被视为独立的大型数据中心的设施,如今只不过是更大规模数据中心园区中的其中一栋建筑而已,而这样的园区里可能还有数十栋类似的建筑。这类数据中心的运行条件与普通数据中心有着巨大差异:一个功率为 100 兆瓦的人工智能数据中心所需的电力,大约是传统企业数据中心的 25 倍;它需要液冷系统,而这种系统在五年前还无法在商业领域大规模应用;此外,它的电力系统复杂程度甚至与区域变电站相当,远超过普通商业建筑的水平。以往的基础设施、设计、采购和建设方案根本无法满足这些需求。
因此,该行业正经历着工程师和分析师们所称的“基础设施投资超级周期”。预计在未来五年内,全球在数据中心基础设施上的投资额将接近 7 万亿美元,而在 2026 年至 2030 年间还将有大约 100 吉瓦的新产能投入使用。与之相比,在之前的时期里,全球数据中心的产能从 2009 年的 27 吉瓦增长到了 2017 年底的约 38 吉瓦(数据来源:Visual Capitalist)。
这些资本投入既体现了人工智能在全球经济中日益普及的紧迫性,也展现了其巨大的发展潜力。2025 年第一季度,数据中心建设所占据的美国 GDP 比例达到了 1%;这一数字在五年前还是难以想象的(Apollo)。Alphabet、Amazon、Microsoft 和 Meta 计划在 2025 年投入超过 3500 亿美元用于数据中心建设,到 2026 年这一数字还将上升至约 4000 亿美元。据 BloombergNEF 的预测,到 2029 年,用于数据中心的总支出将达到 3.3 万亿美元。作为对比,在 2010 年代初至中期,全球每年在数据中心设备和系统上的支出还仅处于数十亿美元的级别(Visual Capitalist)。

数据中心价值链
构建并运营现代化的 AI 数据中心涉及一系列相互关联的工业系统,每个系统都有各自的供应链、劳动力、监管环境以及瓶颈问题。一旦某个环节出现故障,就会对后续环节产生连锁影响。
以下是该流程的逐层示意图。对于每一层,我们都会找出其中的关键活动,以及目前制约这些活动的瓶颈所在。
第一阶段——选址与供电
一切都要从土地和能源开始,而且越来越倾向于按照这个顺序来考虑问题。在该行业发展的大部分时间里,选址工作都是由从事商业地产领域的人士负责处理的。随着 GPU 时代的到来,能源成为了最关键的制约因素,这使得选址规划从单纯的区域划分与租赁谈判,转变为更接近于基础设施建设的流程。如今,运营商不能再仅仅从电力公司购买能源后就不再关心它了。一个现代化的园区需要多种能源供应方式,并且这些能源供应必须在一个严格的时限内得到妥善管理:在提交并入电网的申请时,就要清楚知道还需要等待多年;为了确保短期内的能源供应,可以采用分布式发电方式;而对于更长期的能源需求,则需要与地热或核能供应商签订长期协议。电网连接和建筑竣工的时间往往不同,因此能源策略就必须填补这一时间差。
瓶颈
🚨互连队列已成为主要的限制因素
截至 2026 年初,美国的并网等待名单上共有 2,600 吉瓦的发电及储能项目,这一数字是该国现有实际发电能力的两倍多,平均等待时间在 5 到 7 年之间(Enki)。在 ERCOT 地区(用电力行业术语来说就是德克萨斯州),410 吉瓦的庞大负荷等待名单中,有 87%属于数据中心项目。这种矛盾源于结构上的问题:数据中心需要在 18 到 36 个月内建成并投入运营,而大多数地区的电网无法在这么短的时间内容纳这些设施。
🚨社区与监管方面的反对已成为重大的发展风险
根据《数据中心观察》的报道,由于社区方面担心相关项目会带来成本与资源方面的问题并因此提出反对,2024 年 5 月至 2025 年 3 月期间,有超过 640 亿美元规模的数据中心项目被推迟或取消。在德克萨斯州,第 6 号参议院法案要求将电网升级的成本直接由大型数据中心使用者承担,并规定了在项目早期就必须公开相关信息的义务。
🚨水资源短缺正成为项目选址的障碍
截至 2026 年 5 月,在计划建设的 809 座美国数据中心中,有 517 座位于过去一年里曾出现干旱的地区(来源:ConstructConnect)。虽然现代液冷技术能够降低每单位计算量所需的水资源消耗,但数百吉瓦的新建数据中心集中分布在原本就水资源紧张的地区,这进一步加剧了水资源消耗问题。如今,水资源的可用性以及当地的水资源管理政策,已成为选择数据中心选址时需要考虑的重要因素,而这些在传统 CPU 数据中心时代是不存在的。
🚨隐式发电方式存在自身的供应链难题
仅用一年时间,燃气轮机的需求量就几乎达到了三菱电力十年市场预测数值的两倍。燃料电池制造商也面临着同样的压力:Bloom Energy 的目标是在 2026 年底前实现 2 吉瓦的年产能。那些没有提前确定设备采购计划的运营商们也逐渐意识到,BTM 发电方式本身也需要多年的采购周期。
🚨替代方案尚未达到所需的规模与速度。
2026 年,地热能应用将首次实现商业化发展(可参考 Fervo 在犹他州建设的第一个 500 兆瓦级项目以及该公司最近的上市情况)。各大大型企业都在签署与核能相关的长期供应协议,但首个基于核能的 AI 数据中心预计要到 2027 年才能投入运营;而小型模块化反应堆则还需要十年时间才能得到实际应用。燃料电池的部署速度虽然快于传统涡轮机,但其目前的应用规模仍较为有限。Dynamo 旗下的公司 Celadyne 认为,燃料电池的规模限制本质上源于材料问题,而性能更优且能够大规模生产的膜材料,则是解决这一问题的关键。
第二阶段——构建
数据中心建设已演变成一种典型的工业项目管理问题。其施工方式也从传统的现场逐项建造,转变为模块化、预制化的施工模式——电气室、冷却系统以及数据处理单元等都在工厂中预先组装好,然后再运送到施工现场。最成功的建筑公司不再像传统承包商那样行事,而是更像是航空航天领域的总承商,负责组装那些在工厂中制造好的关键组件。这正是我们之前提到的“建造工业化”趋势的体现,也就是让建筑行业采用与制造业相同的理念和流程。而制约这一发展的关键因素则是人才:那些负责建造和调试设施的工人(电工、管道安装工、暖通空调及控制系统专家、调试工程师),以及那些在设施投入运行后负责其维护管理的工人。而在 GPU 时代,这些人才的培养速度远远跟不上需求的发展。
瓶颈
🚨建筑行业劳动力短缺,导致项目进展严重受阻
据 ConstructionDive 的统计,美国建筑行业目前缺少约 439,000 名技术工人。而那些涉及机械、电气和管道系统的专业人才——比如电工、暖通空调技术员以及控制系统专家——则需要数月时间才能招募到,而且也无法用其他人替代。超过一半的在建数据中心项目都因劳动力短缺而面临延误。Dynamo 的子公司 RecordLens 利用人工智能驱动的现场作业与项目管理平台,为这类专业承包商解决这些难题,尤其是那些与项目管理及合规要求相关的难题。
🚨采购流程分散,缺乏协调机制
在每次项目施工过程中,这些独立承包商会与二三十家不同的供应商签订合同,而整个物料清单的信息却无法实现统一管理。变压器的交付日期、开关设备的制造进度以及制冷设备的交货时间,都只能通过电子表格或独立的系统来记录。一旦某个部件的供应出现延迟,其影响会逐步波及整个项目进度,往往直到造成高昂的额外成本时才被察觉。RecordLens 平台能够帮助解决这类协调问题,确保所有相关方都能按照规定要求开展工作,及时处理材料供应方面的延迟问题,同时还能在操作层面和财务层面准确反映任何变更或项目范围扩展的情况。
第三阶段 —— 装修
在机壳组装完毕并通电之后,接下来的环节就是设备安装,而这正是资本支出最集中的部分——包括芯片以及用于确保其在高负荷状态下仍能正常运行的冷却系统。计算硬件是整个构建过程中的核心投入,其供应链也最为复杂;正因如此,像阿波罗、黑石和博通那笔 350 亿美元的融资交易中,GPU 相关支出就被视为基础设施项目,而非单纯的科技产品采购。
新型 GPU 产生的热量使得原本依赖空气冷却的 CPU 机架冷却方式不再适用,其产生的热量高达 5–20 千瓦。而功率在 40–300 千瓦以上的 GPU 机架则不得不采用成本更高、结构更复杂的液冷方案。目前,最常见的液冷方式是直接芯片冷却技术(占 2026 年市场规模的约 65%),这种技术通过铜板将液体直接输送到芯片上。至于将整个服务器浸入非导电流体中的全浸式冷却方式,则仅用于密度极高的超大规模数据中心以及高性能计算环境中,因为它需要专门的硬件支持,且操作流程也更为复杂。
瓶颈
🚨变压器及开关设备的交货周期是最大的采购制约因素
变压器的交货时间已延长至 4 到 5 年,而在人工智能出现之前这一时间为 12 到 18 个月;而开关设备的交货时间则长达 60 周以上(据路透社报道)。这些都是经过特殊设计的组件,由少数全球供应商生产,而这些供应商的订单量已经排到了数年后才能完成。哪怕只有一台变压器的供应出现延迟,也会导致一个已经建成并投入使用的校园数月无法正常使用。
🚨AI 加速器领域的供应集中状况带来了系统性采购风险
NVIDIA 占据了人工智能加速器市场大约 80%的份额,这类加速器专为在数据中心中处理人工智能相关任务(训练与推理)而设计。Google、Amazon 和 Microsoft 推出的定制化应用专用集成电路虽然性能日益强大,但却局限于各自的云生态系统之中,而且由于软件迁移成本极高,因此无法面向更广泛的市场推出。
🚨硬件更新周期的缩短速度远远超出了运营商的规划能力
GPU 的代际更迭周期为两到三年。以 H100 级硬件为设计基础建造的数据中心,在其资产尚未完全折旧之前,可能就需要引入 B200 级硬件,这就需要对电力与冷却设施进行升级,而这些原本并不在最初的资本规划之中。
🚨高带宽内存(HBM)存在供应瓶颈
HBM 与 GPU 芯片一同封装,全球仅有三家制造商能够大规模生产它。HBM 的供应状况与 GPU 的供应状况密切相关;一旦该供应链出现问题,就会直接影响 GPU 的供应情况。
🚨目前大多数数据中心在散热性能方面无法满足人工智能应用的需求。
标准的数据中心设施设计时,每个机架的功率为 5–20 千瓦。而要支持 100–300 千瓦级的 AI 计算需求,就需要对结构进行加固、铺设新的管道系统、升级电力分配系统;在很多情况下,甚至还需要更换整个冷却系统。在现有的数据中心中,进行这样的改造成本极高,因此全球范围内有相当一部分数据中心已不再适合用于大型语言模型的训练。
🚨液冷供应链面临压力,且在大规模应用方面尚不成熟
液冷基础设施面临着一个日益严峻的问题:相关设备需要很长时间才能到货(制冷机及冷却液分配装置的交货周期在 12 到 16 个月之间),而当这些设备最终到货后,调试人员也缺乏相应经验,因为此前还从未有过如此大规模的液冷系统需要调试。
第 4 阶段 —— 连接与运行
将硬件安装到建筑内只是完成工作的一半而已。另一半工作则是让这些硬件能够高效地发挥作用。要构建大规模的 GPU 集群,就需要专门设计的内部网络——这种网络能够让数千块芯片快速相互通信,从而共同处理复杂的任务。这类网络与传统数据中心所需的网络有本质上的不同,因为人工智能训练要求所有芯片之间能够以极低的延迟实现互联,而不仅仅是实现用户与服务器之间的数据传输。再加上那些用于实时管理电力供应、散热、处理能力以及任务调度等的软件系统,原本属于基础设施层面的问题就变成了运营层面的问题。那些配备了昂贵硬件,但利用率仅为 30–50%的设施,其实就跟运作不善的电子商务仓库没什么两样。
瓶颈
🚨 用于连接 GPU 集群的组件很难采购到
要构建一个由 10 万块 GPU 组成的集群,就需要数十万个光收发器——这类小型组件负责将电信号转换为光信号,从而实现芯片与交换机之间的数据传输。它们并不引人注目,在采购规划时也容易被忽视;此外,目前的供货周期远远超出了相关方的预期。对于那些人工智能应用所必需的大型光收发器来说,其供货周期甚至长达 40 周以上(Utmel)。有一些大型项目虽然已经备好了 GPU,但由于光收发器的供应未能与 GPU 同步保障,因此无法将它们连接起来。
🚨 除了那些大型科技企业之外,目前还不存在能够大规模设计和运营这类网络的相关技术。
AI 训练集群的内部网络架构是一门专门的学科,大多数数据中心运营商此前从未接触过这一领域。那些大型云计算企业则拥有专门负责这一工作的团队;而其他企业则必须在尝试让设施投入使用的同时,从零开始积累相关技术能力。集群的实际需求与现有人才队伍的能力之间的差距,其实是一个被忽视的严重制约因素。
🚨 相关的网络技术标准仍在制定中
在过去的十年中,大多数人工智能计算集群都使用一种名为 InfiniBand 的专用网络协议,因为它的延迟最低。如今,高速以太网在性能方面已经能够与它相媲美,预计到 2029 年将成为主流标准。那些目前就必须做出长期基础设施投资决策的运营商,是在这一技术变革尚未完成之前就做出决定的,而一旦选择错误,后续的纠正将会带来巨大的成本,因此这无疑是一种相当大的规划风险。
🚨 用于运行数据中心的软件并非为处理人工智能任务而设计的。
大多数运营商用来监控和管理其设施的平台,其实是为另一个时代设计的:那时的工作负载是固定的,硬件采用风冷方式,且能耗水平也易于预测,便于制定相应的规划。这些平台无法实时告知运营商每块 GPU 的负载情况、在冷却系统出现故障之前还有多少散热余量,也无法检测出哪些芯片在持续高负荷运行下正在逐渐损坏。因此,那些并非大型云计算公司的机构,往往会在不知情的情况下,让大量昂贵的 GPU 计算资源处于闲置状态。
🚨 数据中心必须响应电网需求,但却缺乏相应的软件来实现这一功能。
2025 年 12 月,美国联邦政府颁布了一项指令,将大型数据中心视为电网级资产。这意味着,在电网负荷过重时,这些数据中心有义务减少电力消耗。为了满足这一要求,并获得因积极参与电网运行而带来的经济利益,就需要能够根据电价信号实时调整工作负载的软件。而在那些大型科技企业之外,目前还不存在具备商业应用规模的此类软件。
第 5 阶段 — 退出
数据中心的每一件硬件都有其使用寿命,而当这些硬件达到使用年限时,其处理过程会比大多数运营商预想的要复杂得多。报废处理需要对资产进行清点、按照相关标准对数据进行处理、记录资产的流转情况,此外还要考虑将这些硬件重新出售或回收利用的问题。每一个步骤都涉及到相应的合规要求与商业考量。看似简单的废弃物处理问题,实际上其实是物流、合规性以及资产管理等多方面问题同时存在的体现。
瓶颈
🚨 尚无平台能实现人工智能时代下的设备退役流程标准化。
如今的 IT 资产与处置业务,是在企业硬件折旧周期较长、合规要求相对较低、二级市场价格也较为稳定、便于协商的背景下发展起来的。而人工智能时代的状况则完全相反:随着达到报废期限的 AI 硬件数量迅速增加,目前还没有任何平台能够对这类硬件进行统一管理。
🚨 次级市场的价格波动剧烈,且缺乏完善的定价机制。
GPU 二级市场的变化速度远远超过现有任何定价系统所能追踪的速率。如果基于过时的数据来做出决策,那么相关企业可能会因此损失数百万美元的资产价值。我们之前就见过这种情况,正是它催生了货运现货市场中的软件应用机会。
投资机会
上一个重要的工业周期是由卡内基、范德比尔特、西屋、洛克菲勒和福特等人所创造的。他们敢于建立那些至今仍被我们广泛使用的关键工业能力,比如钢铁加工、航运、能源的生产与分配以及制造业。我们认为,下一个工业周期将会由那些能够妥善处理垂直整合与外包之间的关系,并将各种技术融入到由软件、协调基础设施以及劳动力平台构成的新工业体系中的人来打造。以下是我们认为在上述数据中心价值链的各个阶段都存在发展机遇的一些例子,当然这并非全部。
专为数据中心设计的新型解决方案。如今,没有哪家数据中心运营商能够找到一家能够承担其所有能源与冷却需求外包服务的合作伙伴。那些能够提供端到端解决方案的公司,将占据一个发展前景良好、至关重要的市场位置,因而也具备较强的竞争优势。我们感兴趣的是能够将来自电网的电力、表后发电设备、冷却系统以及相关的监管要求整合为一个统一系统来进行管理和调控的能力。
针对各类技术工种的劳动力平台。数据中心的建设凸显出了技术工种短缺的严重性。我们认为,机遇在于打造一个垂直整合型的平台,该平台能够掌控从人才招募到岗位分配的整个流程,从而重建 40 年前就已断裂的雇主与相关机构之间的合作关系,并通过积累相关数据来提高后续人才匹配的准确性。
一家专门生产电气设备的代工企业。与过去 25 年来消费电子行业的发展趋势不同,尽管各类品牌产品之间的创新和差异化程度较低,但用于电力分配的关键设备仍未实现商品化。鉴于变压器、断路器及开关设备存在长期的库存积压问题,我们认为现在正是需要这样的代工企业的时机——它们能够大规模生产具有竞争力的产品,从而确保对核心电网供应链的控制权,同时为计算基础设施的建设以及产业回流提供支持。
针对 GPU 基础设施的预测性维护。与数据中心行业以往所处理的任何设备相比,GPU 集群的性能衰退速度更快,且其衰退趋势也更难以预测;哪怕只有一块芯片出现故障,都可能让价值数十万美元的训练任务无法继续进行。这个问题其实与我们之前在制造业中见过的工业预测性维护软件所面临的问题类似。
资产生命周期管理。随着人工智能硬件设备的日益普及,其报废处理流程——包括库存管理、数据清除、责任追溯记录的整理,以及这些设备在二手市场的再销售——都需要相应的能力,而传统的 IT 资产处置体系并不具备提供这些功能的能力。我们认为,有必要为 GPU 计算硬件构建一套端到端的逆向物流平台。
我们接下来该往何处去
对于 Dynamo 来说,数据中心所带来的挑战并非什么新鲜事。它们属于实体经济领域中的新型工业设施,而解决这些挑战的方法与以往处理各类问题时所用的方法并无不同——那就是深入理解系统,以便在市场价格上升之前就发现其中的限制因素。我们正在积极与这条价值链上的各类创业者取得联系。如果您正在处理这类问题,或者认识有这样的人,我们希望与您交谈。资金虽然充裕,但对相关问题的深刻理解却十分稀缺;而这正是 Dynamo 被创造出来所要解决的复杂问题。