根据 Together AI 公告,Decagon 团队在完成向开源平台的迁移后,推理成本降至原来的六分之一,并且在部分任务上表现优于此前使用的闭源系统。(该数据来自公司自身公告,缺乏独立第三方验证)这个案例正在以不同版本在硅谷的工程团队中重复上演。TechCrunch 援引 OpenRouter 的研究数据指出,过去十二个月全行业开源模型使用量增长了三倍。推动这一转变的不是意识形态上对“开放”的偏好,而是更冷酷的计算:当一个企业每月在推理调用上烧掉七位数美元时,六到二十倍的成本差距不再是技术选型问题,而是生存问题。企业预算负责人开始将推理成本视为需要持续优化的运营支出项,而不仅仅是研发部门的实验性开支。这意味着每一代新模型的发布都会触发一轮总拥有成本的重新核算——闭源 API 按 token 计费的模式让规模化部署的边际成本几乎与使用量同步线性增长,而开源模型在自托管或专用集群上运行的成本曲线则完全不同,初始工程投入之后的单位成本随着规模扩大而显著递减。这种结构性差异正在重新划分 AI 部署的盈利边界。这场静默的迁移浪潮在资本市场找到了对应物。2026 年 7 月 1 日,旧金山 AI 基础设施公司 Together AI 宣布完成 8 亿美元 C 轮融资,投后估值 83 亿美元。领投方是沙特阿美旗下风险投资部门 Aramco Ventures,英伟达、Vista Equity PartnersGeneral CatalystEmergence CapitalSalesforce Ventures、March Capital、和硕及 SentinelOne 旗下 S Ventures 等参与本轮。

字段 内容
公司 Together AI
轮次 C 轮
金额 8 亿美元
估值 83 亿美元(投后)
领投方 Aramco Ventures
参投方 Nvidia
参投方 Vista Equity Partners
参投方 General Catalyst
参投方 Emergence Capital
参投方 Salesforce Ventures
参投方 March Capital
参投方 Pegatron(和硕)
参投方 S Ventures (SentinelOne)
总部 旧金山
创始人 Vipul Ved Prakash(首席执行官)
成立年份 2022 年
官网 https://www.together.ai/

预订额突破 11.5 亿美元背后,合同与现金之间仍有缝隙

Together AI 披露,最近一个季度年化预订额已超过 11.5 亿美元。预订额是客户已签署合同的未来服务承诺——在云计算行业,它与实际确认收入之间存在行业性的折扣和滞后。公司自身也明确区分了这两个概念,将预订额描述为“已签约未来服务的合同金额”。这种表述本身反映了公司在财务信息披露上的谨慎态度,但也为外部观察者留下了一个关键的待回答的问题:这些合同承诺将以多快的速度、多大的比例转化为实际消耗的计算资源,进而确认为收入。

这一指标的披露策略值得审视。在 GPU 云服务中,客户签约与实际使用之间存在多种变量:集群是否已上线、客户自身业务增长速度、以及是否存在超额预订再分配的行业惯例。超额预订是云计算行业的常见做法,供应商通常会销售超过物理可用容量的合同,基于客户不会同时使用全部资源的统计假设。这种做法在经济上行周期有效,但在需求集中爆发时可能导致性能下降和服务级别协议违约。11.5 亿美元这一数字让 Together AI 与尚处于预订前阶段的 GPU 租赁公司拉开了叙事距离——那些公司可能拥有大量 GPU 订单但没有相应的客户承诺——但它无法直接等同于收入质量。当一家公司计划在未来五年将计算容量扩大约五十倍时,预订额的增长很大程度取决于基础设施能否按时交付,这本身就是当前 GPU 供应链中最不稳定的环节之一。电力设施审批周期、高压变压器制造周期、专用冷却设备的供货排期,这些物理世界的约束可能比客户需求的变化更难预测和管理。

推理层成为 AI 价值链中最拥挤也最昂贵的赛道

Together AI 所处的市场并非蓝海。Baseten 据报道正在以 110 至 130 亿美元估值融资 15 亿美元;Fireworks AI 据彭博社报道在 150 亿美元估值进行融资谈判;Groq 凭借自研 LPU 芯片架构在低延迟推理场景中建立差异化;Modal 则在开发者体验和无服务器部署层面构建产品壁垒;CoreWeave 于 2025 年上市成为该领域唯一可比的公开市场标的;Lambda 和 Crusoe 今年也完成了九位数轮次融资。这些公司虽然都贴着“推理基础设施”的标签,但各自的定位存在微妙差异:有的侧重纯粹的 GPU 租赁经济,有的绑定特定硬件架构,有的强调模型无关的通用推理平台。Together AI 选择了一条中间路线——以开源模型为锚点,向上整合模型库和推理优化工具,向下贴近英伟达硬件生态。

在此格局中,Together AI 现估值 83 亿美元,是 2025 年 2 月 33 亿美元估值的 2.5 倍,而 2024 年 3 月为 12.5 亿美元。这种估值扩张速度意味着投资者对公司增长曲线的斜率有着极为乐观的预判。投资者的定价逻辑不在于当前收入水平——对于一个年化预订额刚突破十亿美元的公司而言,83 亿美元的估值隐含的市销率倍数相当高——而在于对开源模型推理市场整体规模的预期定价,以及 Together AI 在这个市场中占据的份额假设。然而,CoreWeave 作为已上市的可比公司提供了公开市场估值参照,其股价波动和估值倍数的变化为 AI 基础设施类资产提供了真实的价格发现机制。如果 CoreWeave 的公开市场估值出现下调,这一信号将不可避免地影响投资者对 Together AI 同类资产的定价预期。Together AI 的估值倍数建立在远超可比公司的增长速度假设之上,这一预期一旦在任何季度出现增速放缓,二级市场的调整逻辑对一级市场估值的反向传导将非常直接。

Together AI 的差异化定位在于开源模型专属化,而不仅仅是 GPU 租赁。公司支持 DeepSeek、Nemotron、MiniMax、Kimi 等开源模型,提供训练、微调和推理的整合服务。其 ATLAS speculative decoding 引擎声称能优化推理效率——这可能是公司试图在纯基础设施之上构建软件附加值的关键技术组件。推测解码技术的原理是通过一个轻量级的“草稿模型”快速生成候选 token 序列,再由主模型进行并行验证,从而在保持输出质量不变的条件下降低延迟和提高吞吐量。如果 Together AI 的 ATLAS 引擎确实在该技术上取得了工程突破,这可能形成与通用 GPU 租赁商之间的可防御的竞争壁垒。但区分“开源模型云”和“GPU 租赁加模型库”在实际产品层面并不总是清晰——客户最终比较的是每 token 成本,而不是技术路线的标签。如果竞争对手通过更优的硬件采购成本或更高的资源利用率实现了更低的 token 单价,模型层的故事将退居其次。

在英伟达的芯片上,软件层的股权博弈正在成型

英伟达在本轮中的参与并非普通财务投资。2025 年 3 月,Together AI 已成为英伟达云合作伙伴,当时公司披露拥有超过 200 兆瓦的数据中心和电力容量,以支撑大规模 AI 工作负载。英伟达正在系统性地投资那些决定其 GPU 利用效率的软件层公司——Baseten 和 Fireworks AI 也在其布局之列。这种投资模式呈现出一种清晰的垂直整合逻辑,区别在于英伟达并不直接收购这些公司,而是通过少数股权投资和云合作伙伴关系建立一种松耦合的产业联盟。

这一模式的底层逻辑是:英伟达向 Together AI 销售芯片获取硬件收入,同时通过股权投资分享其软件和推理服务增长的红利。当同一个实体既是核心供应商又是股东时,定价权和供货优先级就变成了一道需要持续管理的关系方程。对 Together AI 而言,英伟达的背书带来了芯片获取的可预期性——在 GPU 持续供不应求的市场环境中,这种可预期性本身就是稀缺资源。但也意味着一部分独立性被嵌入股权结构:如果未来出现替代英伟达 GPU 的芯片选项,或者公司需要就采购条款进行强硬谈判时,股权关系可能形成掣肘。在 AI 基础设施军备竞赛中,这是一种便捷的优势——只要英伟达继续以同一套逻辑平等对待所有同类合作伙伴。然而,同时投资多家互为竞争对手的推理基础设施公司,意味着英伟达对单一被投企业的战略承诺存在上限。每一家被投公司都需要衡量,自己从英伟达获得的支持是否仅是维持市场竞争均势的水平,还是足以形成真正的资源倾斜。

客户实证正在积累,但规模化的验证周期才刚刚启动

除 Decagon 外,Together AI 点名了 Cursor 和 Cognition 作为客户。三家公司分别属于 AI 客服、AI 编程助手和 AI 软件工程领域——它们自身都是处于成长期的公司,其 AI 工作负载的增长既体现了 Together AI 的服务能力,也将考验其基础设施的弹性。当客户的业务快速增长时,它们对推理资源的需求呈现非线性的扩张模式;而当客户遭遇增长瓶颈时,已签署的预订合同能否足额履约也将面临不确定性。这三家客户的业务形态各异,但它们共享一个特征:都是软件产品驱动型的公司,其终端用户的每一次交互都可能触发多次模型调用。这意味着 Together AI 服务的客户群体是具有高推理密度的应用开发者,而非仅仅将 AI 作为内部效率工具的传统企业。这种客户结构可能带来更高的资源利用率和更强的增长杠杆,但也使得公司的业务健康度与传统 SaaS 指标——如客户留存率、净收入留存率——之间的关联性更加复杂。

开源模型的推理成本优势已被多个独立来源交叉验证。TechCrunch 报道引述 OpenRouter 研究称全行业开源模型使用量过去一年增长三倍。来自企业预算层面的结构性动力对这一趋势形成支撑:当前沿闭源模型(如 OpenAI 和 Anthropic 的旗舰产品)维持高端定价时,开源模型可被微调并以低成本自托管的路径,在总拥有成本计算中变得越来越难以忽视。Together AI 声称,Decagon 迁移后推理成本降低六倍的案例并非孤例(该数字为公司自报,未获独立验证)——当一个企业客户的 AI 调用量达到一定规模,自建或租用开源模型推理集群的固定成本被分摊到海量 token 上,单位成本将逼近甚至低于闭源 API 的边际成本。这个临界点的位置取决于开源模型的精度是否满足任务要求、工程团队是否有能力完成微调和部署,以及推理集群的利用率是否维持在健康水平。

然而,从成本优势到市场统治力之间隔着多个验证步骤。开源模型的精度在哪些场景中已追平闭源系统?Decagon 的案例表明在某些客服或文档处理类任务中开源模型可能已经足够,但这不能外推到所有的企业级应用场景。客户在微调和运维上需要投入多少工程资源?这一部分人力成本在不同规模的企业中差异极大,对于缺乏机器学习工程团队的中小企业而言,即使推理成本降低六倍,微调和部署的技术门槛仍可能将它们挡在开源方案之外。这些问题决定了推理成本六倍降幅对企业总成本的实际影响。Together AI 尚未披露客户留存率、净收入留存率或平均合同期限等反映客户健康状况和收入可预测性的关键指标。这些指标将揭示预订额的高增长背后是否存在高流失的风险——如果客户在初次签约后由于实际性能不达预期或自身业务波动而收缩使用量,11.5 亿美元的预订额数字将无法全部转化为收入。

五十倍扩容:工程命题与资本命题是两个不同的问题

Together AI 计划在未来五年将计算容量和基础设施扩大约五十倍。这一目标在工程维度和资本维度上都构成巨大考验,而这两个维度虽然相互关联,却由完全不同的资源条件驱动。

工程维度上,超大规模数据中心的电力获取、冷却系统和网络架构不是在五年内可以线性扩展的。200 兆瓦的起点意味着五十倍扩张后的 10 吉瓦级别——这相当于一个大型城市的总用电量。电网接入审批的周期在许多地区以年为单位计算,且选址能否获得足够的电力配额并不取决于申请方的资本实力,而是取决于当地电网的冗余容量和监管机构对新增电力负荷的分配优先级。变压器等关键电力设备的交付时间在过去几年中因供应链瓶颈而显著延长,从下单到安装的周期可能超过两年。冷却系统方面,高密度 GPU 集群对液冷技术的需求正在成为新建数据中心的标配,而液冷系统的设计、部署和维护复杂度远高于传统的风冷方案,工程人才储备也更为稀缺。这些物理约束意味着五十倍扩容能否在五年内实现,不仅取决于资金是否到位,更取决于项目启动的先后顺序、与各地电力公司和设备供应商的谈判能力,以及工程建设过程中可能出现的各种非预期延迟。

资本维度上,8 亿美元的新资金在五十倍扩张面前并非充裕。以当前大规模 GPU 集群和配套数据中心的建设成本估算,五十倍容量扩张的总资本支出很可能达到数百亿美元的级别——这远超单一风险投资轮次所能覆盖的范围。这意味着持续的后续融资将不可避免,无论是通过后续股权轮次还是债务工具。本轮引入 Aramco Ventures 是一个信号——主权资本对 AI 基础设施的兴趣正在从波斯湾加速输出。Prosperity7 Ventures 美国董事总经理 Abhishek Shukla 明确表态:“未来十年建设 AI 基础设施将是人类历史上最大的基础设施工程。”这一论调既解释了主权基金入场的动因,也暗示了持续烧钱规模的预期。如果这一论调成立,那么 AI 基础设施将成为与油气、电力和交通基础设施并列的资本配置赛道,其融资模式可能逐渐从风险投资逻辑转向项目融资逻辑——即依靠长期合同和稳定现金流来支撑巨额债务,而不是单纯依赖股权稀释来获取扩张资金。对于 Together AI 而言,能否在预订额的基础上逐步过渡到可预期的经常性收入,将决定它能在多大程度上解锁债务融资这一更高效但更严苛的资本工具。

主权资本入局加速,地缘政治成为无法回避的变量

Aramco Ventures 作为领投方出现在一家美国 AI 基础设施公司的股东名单中,这一交易结构在中美技术竞争和沙特自身经济转型的双重背景下具有超出融资的含义。Prosperity7 Ventures 在此前已与 General Catalyst 共同领投了 Together AI 的 B 轮——那一轮融资为 3.05 亿美元,估值 33 亿美元——本轮由 Aramco Ventures 直接领投,显示出沙特资本在 AI 基础设施领域的布局正在从早期风险投资扩展到成长期的大规模资本部署,从专注前沿技术的前沿实验室扩展到物理基础设施层的重资产投入。这与沙特“愿景 2030”经济转型计划的方向一致:减少对石油收入的依赖,在全球科技基础设施领域建立长期资本存在。

这种主权资本与 AI 算力基础设施的对接将不可避免地引发监管审查。美国外国投资委员会此前对涉及关键技术的外国投资介入的审查标准不断调整,而 AI 基础设施是否被纳入敏感资产范畴尚无明确先例。与半导体制造和基础模型开发不同,推理基础设施位于价值链的中游——它不生产芯片,也不开发前沿模型,但它是连接硬件和应用的枢纽。如果监管机构将大规模 AI 算力集群视为关键基础设施,那么涉及外国主权资本的股权交易可能需要经历更严格的审查流程。这一不确定性是 Together AI 自身无法控制的,却与公司未来的资本路径深度绑定。如果监管环境趋紧,公司在后续融资中引入其他主权资本或来自特定国家的战略投资者时将面临更多限制,这可能影响其资本获取的速度和可选菜单。

开源模型的精度追赶速度定义天花板,而非地板

Together AI 的增长叙事建立在一个前提之上:开源模型与闭源前沿模型之间的性能差距将持续缩小,甚至在某些任务上实现反超。这一前提在过去十八个月中确实得到了部分验证——多个开源模型在特定基准测试中已接近或超过同等规模的闭源系统。DeepSeek、Llama 系列和 Mistral 等模型的快速迭代表明,开源社区的工程能力正在以前所未有的速度追赶拥有大量专有资源的闭源实验室。部分原因是模型架构和训练方法的信息传播在开源生态中几乎没有时滞,每一次前沿论文的发表都可以在数周内被开源社区吸收和复现。

但“任务特定性能可媲美”并不等同于“全场景可替代”。在需要复杂推理链、多步规划和工具使用的企业级应用中,闭源前沿模型仍然占据优势。这些场景往往要求模型不仅生成单个答案,还要在多次调用中保持逻辑一致性、正确调用外部工具和数据库,并在长上下文中维持准确的信息跟踪能力。开源模型在这些复杂能力上的追赶进度可能比单项基准测试的追赶进度更为缓慢。如果开源模型的追赶曲线出现平台期——即在大规模预训练的边际收益递减规律作用下,后续版本的性能提升逐渐放缓——Together AI 所承载的推理需求增长速度将相应放缓,因为企业客户在核心任务上仍将保留闭源方案作为主力,仅将开源模型用于对精度要求较低的辅助场景。

反之,如果开源模型的突破速度超出预期——例如出现某种新的训练范式或架构创新,使得开源模型在复杂推理任务上的表现逼近甚至超越闭源系统——基础设施层将迎来远超目前预订额的增量需求。这种情况下,Together AI 当前看似激进的五十倍扩容计划可能反而显得保守。这也是投资者愿意接受当前高估值的核心期权价值:他们购买的不仅是当前的预订额增长曲线,更是一个开源 AI 全面渗透企业级应用时的市场占有权。这个期权的价值取决于一个不确定的时间节点——开源模型何时在主流企业任务上实现“足够好”的性能,使得从闭源 API 迁移的决策从“成本优化”升级为“默认选择”。在这个时间节点到来之前,Together AI 的高估值将始终伴生着高波动性:任何关于模型性能差距变化的信号都会引发对其增长假设的重新定价。

RecodeX 极客视:Together AI 83 亿美元的估值本质上是在为两条汇聚的曲线定价——企业从闭源 API 出逃的速度,与开源模型追赶闭源性能的速度。8 亿美元新资金和五十倍扩容计划将这场赌注从商业模式层面推向了基础设施工程层面,电网审批和变压器交付将成为与模型精度同样关键的投资回报变量。英伟达以股东身份出现在芯片买方的资本表上是产业垂直整合的新常态——这种模式在短期提供芯片获取的可预期性,在长期则意味着独立性被部分嵌入股权结构。Aramco 主权资本的领投则标志着 AI 基础设施已经进入国家资本配置的视野,这让它不再只是一场硅谷的创业竞赛,而是一个需要在地缘政治坐标系中持续导航的产业命题。