AI 推理市场
10:通过阅读相关资料、与各类初创公司创始人交流,以及观察代币经济的发展态势,我对人工智能推理技术有了更系统的认识。
2025 年 2 月,我发布了自己的第一篇 Substack 文章《AI 智能体,这真的存在吗?》。在文中我认为完全自主的智能体距离实现还有数月时间,而非数年,而信任才是真正的障碍。17 个月后,显然 AI 智能体已经真实存在了。不过我当时忽视的是支撑这些智能体的基础设施,也就是如今我们所称的 AI 推理技术。
我当时所撰写的每一个智能体,归根结底都属于计算能力的下游应用。到了 2026 年,AI 推理领域已出现了激烈的竞争,各方都在争夺谁来处理这些 Token、使用何种芯片、以什么价格提供服务,以及服务于哪类用户。

深入解析价值 1 万亿美元的市场机遇
许多人认为,随着企业对计算单元的需求不断增加,AI 推理市场的规模已超过 1 万亿美元,并且还将持续增长。这已不再是一种逆向观点——这一趋势正在深刻影响着私人市场的发展态势。
仅在 6 月的最后两周内,垒就以 130 亿美元的估值完成了 15 亿美元的融资,而在此前 5 个月它还曾以 50 亿美元的估值筹集了 3 亿美元的 E 轮融资。Together AI 则宣布以 83 亿美元的估值进行了 8 亿美元的 C 轮融资,其年度订单额已超过 11.5 亿美元。而最初设计出定制 ASIC 芯片的 Groq,也刚刚获得了 6.5 亿美元的融资,用于进一步发展其推理云平台 GroqCloud。
过去一年里,模型提供商不得不降低价格,但总体推理成本并未下降。这是因为企业正在将工作从人工处理转向智能代理处理,而每单位工作所消耗的算力也更高。模型提供商推出的前沿模型依然是最大的代币消耗者。
工作负载呈指数级增长
目前这个市场最让我感到兴奋的一点是,其应用场景正变得越来越多样化,而且整个技术栈的每一个环节都存在优化空间,这为新的初创企业提供了发展机遇。
3 到 4 年前,“推理”这个概念主要指的是人们向聊天机器人输入内容并等待回复。正是这种应用场景催生了早期的 AI 聊天机器人初创公司,比如 Chai AI(Chai Discovery 的团队)、Talkie AI(MiniMax 的团队)以及 Inword AI;此后这些公司都改变了自身的核心业务方向。
时至今日,应用场景(通常也称为工作负载)的种类似乎已呈指数级增长。它们包括实时语音处理、批量文档处理、夜间自动编码任务、深度研究智能体、RAG 流程,以及介于其间的一切类型。每种工作负载对延迟的容忍度不同、重复处理的模式也各异(这决定了可以缓存的数据量),同时针对最终用户而言,所需的质量标准也有差异。
现在,再将这些与现有的优化层(模型架构、内核、推理引擎、服务基础设施以及模型路由逻辑)结合起来,就会形成一种呈指数级增长的可能性矩阵。由此可见,该矩阵中的每一个单元都可能成为一家新的 AI 推理初创公司的突破口。
例如,在 AMD 芯片上优化语音处理任务与利用缓存中的预训练模型实现全天候的代码生成工作负载属于不同的工程难题,而后者又与将企业搜索延迟控制在 100 毫秒以内的目标有着不同的挑战……
正因如此,我才会认为现在是人工智能推理领域极为有趣的发展时期。大家一直在思考的一个关键问题是:这些新兴的初创公司中,是否有哪家能够成长得和现有的大型人工智能推理企业,比如 Together AI、Crusoe、Baseten 以及 Fireworks 一样强大?
所有人都承诺能为你提供更便宜的令牌。
每家 AI 推理公司都有动力向客户宣称他们能够降低 Token 费用或更高效地利用现有支出。这类宣传通常有以下三种表述方式:
-
将你的令牌引开,避免使用那些前沿模型。选择像 DeepSeek、Qwen、Kimi、GLM 等开源模型即可。
-
在性能更优(或更易获取、成本更低)的硬件上运行,比如 AMD、TPU、定制 ASIC,任何能够降低对 NVIDIA 硬件高昂成本的方案。
-
更智能地处理代理型工作负载本身,比如缓存、调度、批量处理、自定义内核等。
根据 IntuitionLabs 对 LLM API 定价的对比分析,在这个市场中,模型提供商也会频繁调整价格。历史数据表明,每当有新模型推出,此前最先进的模型的每 Token 价格就会迅速下降。例如,Anthropic 将其旗舰模型每百万 Tokens 的定价从 15 美元/75 美元降到了 5 美元/25 美元;DeepSeek 则在 2025 年 9 月将相关模型的价格降低了 50%以上。
新兴推理公司正在如何应对这一挑战
今年我花了大量时间与各类推理技术公司会面。可以明显看出,这个领域存在着一种核心分歧——要么选择硬件路线,要么选择软件路线。支持硬件路线的人认为,拥有或掌控专用芯片(如定制 ASIC、AMD 芯片、TPU)才能带来持久的竞争优势;而支持软件路线的人则认为,真正的优势在于芯片之外的层面,比如算法内核、服务系统,或是针对特定工作负载的优化设计。以下是一个并不全面的分类概览:
硬件层正在下注
芯片领域的竞争策略。无论所使用的芯片是定制的 ASIC,还是非 NVIDIA 品牌的芯片,其核心优势都在于能够避开 NVIDIA 的高昂价格,从而在每处理一个 token 的成本上占据优势。Tensordyne 已与 Broadcom 及 HPE Juniper 合作开发出了 3 纳米制程的定制 ASIC 芯片;该公司还计划在今年晚些时候推出其推理云平台的测试版。General Compute 则从 SambaNova 等公司采购定制 ASIC 芯片,以此作为 GPU 的替代方案。Wafer AI 则在 AMD 芯片上运行开源模型并优化数据传输路径。Open Inference 则选择在 TPU 上采取同样的策略。
软件层正在下注
核心在于内核开发。那些决定模型在特定芯片上运行效率的低级程序——即内核本身,也值得特别提及。这一领域的核心思路是利用 LLMs 来编写定制化内核,从而实现对推理领域中最稀缺且成本最高的专业人才的自动化替代。全球范围内真正具备内核开发能力的人寥寥不足千名,他们中的许多人能获得七位数的高薪,因为即便仅提升 2%的利用率,在大规模应用中也能带来数百万美元的收益。
高通最近同意以约 39 亿美元的价格收购一家与硬件无关的推理技术公司 Modular。Gimlet Labs 则完成了由 Menlo Ventures 领投的 8000 万美元 A 轮融资;其开发的内核技术被用于 PyTorch 的自动内核生成工具 kforge 以及该公司的多云产品。此外,Makora 和 Standard Kernel 也均已获得了种子轮融资。
针对不同工作负载类型的竞争。除了开发定制化内核之外,一些初创公司还试图占据特定类型工作负载的市场优势。Sail Research 刚刚完成了一轮 8000 万美元的融资,该公司的业务重点在于长周期智能体相关工作负载,它将开源模型的服务功能与专为大规模高吞吐量而设计的托管沙箱相结合。就在今天,MachGen 也结束了隐秘发展阶段,正式推出了专注于扩散模型/世界模型工作负载的推理平台。此外还有 Reactor 和 Fal 等初创公司同样将重点放在扩散模型和世界模型工作负载上,且迄今已获得了大量融资支持。同时,也有一些初创公司在秘密研发用于实时语音处理等其他类型工作负载的解决方案。
一些开发者导向的公司选择了另一条发展路径。它们致力于打造面向开发者的 ICP 分发平台,通过使用开源或免费产品先吸引开发者,再逐步实现商业化盈利。ZML 就开源了自身的推理框架,并刚刚推出了 LLMD——这是一款免费的推理服务器,能够在 NVIDIA、AMD、TPU、Apple Metal 以及 Intel Arc 等硬件平台上运行开源 LLM。采用类似策略的还有其他推理引擎公司,比如由 vLLM 的创建者所成立的 Inferact(已筹集 1.5 亿美元融资),以及开发出 SGLang 产品的 RadixArk(该产品获得了 Accel 领投的 1 亿美元种子轮融资);这些公司都在将原本已在众多生产环境中占据主导地位的开源引擎推向商业化应用。
最终目标:人人都能成为新云服务商
最终,这些人工智能推理公司中的许多实际上都变成了新型云服务提供商。
这种融合正从两个方向同时展开。越来越多的新一代云服务提供商——过去仅负责出租 GPU 算力——如今开始寻求直接获取芯片,而不再仅仅依赖 GPU。与此同时,那些最初以路由层或优化服务堆栈为起点的纯软件推理公司,现在也考虑掌控自己的硬件资源,以此确保成本与服务的稳定性。正因如此,这些“软件”推理公司也开始签订数据中心租赁协议和芯片采购合同。
无论采用何种技术方案,这些公司其实都在争夺同样的市场份额。不管他们是租赁芯片、自行设计定制 ASIC、购买非 NVIDIA 品牌的硬件,还是选择开源模型,企业客户最终都可能逐步整合自身的推理预算。所有这些企业都在试图分得一杯羹。我上面提到的各种策略不过是 AI 推理供应商赢得业务的不同手段而已,并不会形成各自独立的市场——投入给某一家公司的钱,就意味着没有投入给其他公司。
关于代理世界的发展前景存在着不同的观点,有人认为在那个环境中推理执行速度可能不再那么重要。许多人则认为更关键的因素是:
-
最终结果(输出)
-
成本(计算成本)
如果有一支代理团队在夜间异步工作,无论其处理速度是每秒 1,000 个标记还是 2,000 个标记都无关紧要。重要的是这项工作能够在经济上持续进行,并且输出结果准确无误。用来描述这类工作负载的术语通常是“长周期”。
我认为这一观点的方向是正确的,但长时延处理的工作负载目前尚未达到大规模应用的水平,而快速生成 Token 依然是当前高端的推理服务产品。目前的收入主要来自那些需要人类干预(或具备以人为核心的使用体验)的工作负载,比如代码辅助工具、语音产品、搜索功能以及面向客户的智能代理。各大推理平台的核心客户,绝大多数都是对延迟极为敏感的应用。
初步迹象显示,速度稍慢的推理方案正在逐渐填补现有的工作负载缺口,但目前尚不清楚它是否会成为人工智能计算领域中占比最大的类型。这也是创业者和投资者们持续试图找到答案的问题。