趋境科技半年融资10亿:AI Token工厂的“水电煤”战争,一场由清华系主导的推理效率革命
当AI行业还在为训练算力的“军备竞赛”而狂热时,一家成立仅三年的清华系公司,却悄悄在另一个战场——AI推理——上,用“Token即服务”(TaaS)的商业模式,半年内撬动了超过10亿人民币的融资。这不仅仅是一笔融资新闻,它揭示了AI产业一个正在发生的根本性转折:从“造脑”到“用脑”的价值链重塑。当国家数据局数据显示,2026年3月日均Token调用量突破140万亿,较两年前增长超千倍,趋境科技的选择,正在被市场验证为一条通往万亿级市场的隐秘通道。但问题是,在巨头林立的AI Infra赛道,这家“精品专卖店”式的Token工厂,究竟凭什么让投资人疯狂加注?它的技术护城河,又能否抵御来自英伟达、云厂商以及众多AI Infra新贵的降维打击?
| 项目 | 详情 |
|---|---|
| 公司名称 | 趋境科技 (Trending Technology) |
| 融资轮次 | A轮 |
| 融资金额 | 累计半年超10亿人民币(含天使++轮、Pre-A轮、A轮) |
| 累计融资 | 超10亿人民币 |
| 领投方 | 河南投资集团汇融基金 |
| 跟投方 | 真知资本、尚势资本、星连资本、上海国方创新、弘晖基金、华控基金、杭州福成(老股东超额增投) |
| 成立时间 | 2023年12月 |
| 总部 | 北京 |
| 官网 | https://www.trendingtech.com |
一、 为什么是“推理”?——当“训练”成为成本黑洞,“Token”才是真正的印钞机
在2023年,几乎所有的AI创业者和VC都在追逐大模型训练。彼时,一个普遍的共识是:谁拥有最多的GPU,谁就能训练出最强的模型。然而,趋境科技创始人兼CEO艾智远,这位清华高性能计算所的博士,却看到了一个截然不同的未来。他抛出了一个在当时看来近乎叛逆的观点:“训练是成本项,推理是赚钱项。”
这个判断并非凭空而来,它根植于对AI产业经济模型的冷峻计算。训练一个千亿参数的大模型,需要数千张GPU卡连续运行数月,耗资数千万美元。但训练完成后,模型若不能投入生产,其价值几乎为零。而推理,则是将训练好的模型部署到真实业务中,每一次用户提问、每一次代码生成、每一次图像识别,都在消耗Token,产生价值。从经济学角度看,训练是沉没成本,推理是边际成本与边际收益的博弈。 当AI应用进入规模化阶段,推理成本将占据AI总拥有成本(TCO)的80%以上。
趋境科技的技术起点,正是清华大学高性能计算研究所(HPC)。这个研究所的背景,决定了他们看待AI的方式与纯算法团队截然不同。HPC的基因让他们天然关注“系统效率”而非“模型精度”。他们意识到,当前AI推理面临的核心矛盾,并非模型不够聪明,而是算力硬件投入与AI Token产能之间存在巨大的转化瓶颈。一块H100 GPU的峰值算力是312 TFLOPS(FP16),但在实际推理场景中,由于内存带宽瓶颈、模型并行效率低下、以及GPU利用率极低(通常低于30%),实际产出Token量远低于理论值。
因此,趋境科技从一开始就选择了一条“反共识”的路径:不追逐模型参数的军备竞赛,而是聚焦于如何用系统架构和工程能力,将每一块GPU的Token产出效率推向极致。他们提出的“Token as a Service”(TaaS)理念,本质上是将AI推理从“手工作坊”式的按需调用,升级为“标准化产线”式的规模化生产。这就像工业革命中,从蒸汽机到电力网的转变——不再依赖单个引擎,而是构建一个高效、稳定、低成本的能源供应网络。
二、 技术深拆:全系统异构协同、以存换算、虚实同构——一场针对“冯·诺依曼瓶颈”的工程反击
要理解趋境科技的技术壁垒,必须先理解AI推理的物理瓶颈。现代GPU推理的痛点,不在计算单元(CUDA Core/Tensor Core),而在数据搬运。冯·诺依曼架构下,计算与存储分离,导致“内存墙”问题:GPU需要不断从显存(HBM)中读取模型参数和中间结果,而显存带宽的增长速度远落后于算力增长。对于千亿参数模型,一次推理需要加载数百GB参数,这导致首Token时延(TTFT) 极高,且并发能力受限。
趋境科技的核心技术,正是针对这一“内存墙”的系统级反击。他们提出的“全系统异构协同”,并非简单的CPU+GPU协同,而是构建了一个包含CPU、GPU、NPU、以及高速互联网络(如NVLink、InfiniBand)在内的多层级异构计算池。其核心逻辑是:将不同计算特性、不同存储层次的任务,动态调度到最合适的硬件上。
1. “以存换算”:这是趋境最颠覆性的创新之一。传统推理中,模型参数是静态存储在显存中的。而“以存换算”的思路是,将部分计算任务“卸载”到存储层。例如,对于Attention机制中大量重复的KV Cache(键值缓存),趋境并非简单地将其存储在显存,而是通过自研的分布式KV Cache管理系统,将高频访问的KV Cache预加载到近端存储(如NVMe SSD或CXL内存),并利用计算存储融合技术,在数据从存储搬运到显存的过程中,完成部分预计算。这本质上是在用存储的容量和带宽,换取计算的延迟和吞吐。根据其技术白皮书,这一技术可将长序列推理场景下的显存占用降低40%以上,同时提升吞吐量2-3倍。
2. “虚实同构”:这是对模型部署方式的彻底重构。传统推理框架(如vLLM、TensorRT-LLM)通常采用“静态图”模式,模型加载后,计算图固定,难以动态适应不同请求的变长序列和不同batch size。趋境的“虚实同构”技术,则是在运行时动态构建“虚拟计算图”。它利用编译器技术,将模型的计算图拆解为多个“微算子”(Micro-Operator),并根据实时负载情况,动态组合这些微算子,形成最优的“物理执行图”。这类似于操作系统的虚拟内存管理,将物理资源抽象为虚拟资源,从而实现零开销的模型热切换和极致的内存复用。当一个请求结束,其占用的显存和计算资源可以瞬间被下一个请求接管,无需重新加载模型,从而将GPU利用率从行业平均的20%-30%提升至70%以上。
3. 多模态工程管线:趋境并未止步于纯文本模型。他们构建了一套统一的多模态Token生产管线,能够将图像、视频、音频等非结构化数据,与文本Token在同一个推理引擎中进行异构处理。这要求系统不仅支持Transformer架构,还要兼容ViT(视觉Transformer)、Whisper(语音)等不同架构的推理。趋境的解决方案是在算子层面实现跨模态的融合,例如,将图像Patch的Embedding计算与文本Token的Attention计算,通过定制化的Kernel(如FlashAttention的变体)在同一流处理器上并行执行,避免了跨模态数据拷贝带来的通信开销。
这些技术组合在一起,形成了一个强大的“系统级护城河”。它不像单一算法优化那样容易被复制,而是需要深厚的系统架构能力、编译器优化经验以及对硬件底层的深刻理解。这恰恰是清华HPC所的核心优势——他们擅长的是“让硬件跑得更快”的系统工程,而非“让模型更聪明”的算法创新。
三、 商业路径:从“卖算力”到“卖Token”,一场价值链条的重构
趋境科技的商业模式,并非简单的“卖软件授权”或“卖算力租赁”。他们提出了两种截然不同但相互协同的模式,旨在重构AI产业的利益分配格局。
模式一:直营模式——成为AI时代的“发电厂”
在这种模式下,趋境科技自己租赁或采购GPU算力(主要来自数据中心、云厂商或第三方算力池),然后通过其ATaaS平台,直接生产高品质AI Token,并销售给头部模型厂商(如智谱、百川、月之暗面)、互联网平台(如字节跳动、腾讯、阿里)、AI应用公司(如AI Coding工具、AI Agent平台)以及大型企业客户。它的盈利模型是:通过技术优化,将单位Token的生产成本降到市场均价的50%甚至更低,从而在定价上获得竞争优势,同时保持高毛利。
根据投资界获得的数据,从2026年春节以来,趋境科技平均单台算力的AI Token生产效率提升3倍以上,总高品质AI Token产量提升30倍以上。其中,某头部万亿级参数大模型,已实现日均万亿级高品质AI Token产能。这意味着,如果市场Token均价为每百万Token 0.1元,那么仅这一个客户,每天就能产生100万元的收入。2026年6月单月收入已超过2025年全年,这验证了其“效率提升→成本下降→需求爆发→收入增长”的正向飞轮。
模式二:共运营模式——成为AI Token工厂的“总包商”
这种模式面向的是拥有算力资源但缺乏运营能力的客户,如上市公司、国央企、各地智算中心。这些机构往往投入巨资建设了算力中心,但GPU利用率极低,沦为“电子垃圾”。趋境科技的角色是:承接AI Token工厂的整体规划、系统集成、建设交付与后续共运营。 它提供一整套“交钥匙”方案,包括硬件选型、网络架构、软件栈部署、模型适配、运维监控等。
这种模式的商业逻辑在于:将客户的“死资产”转化为“活产能”。 客户不再只是“卖算力”(按GPU小时收费),而是与趋境科技分成,共同“卖Token”(按Token产出收费)。这彻底改变了智算中心的盈利模式。传统算力租赁的毛利率可能只有10%-20%,且受制于GPU价格波动;而Token分成的毛利率可达50%以上,且随着技术进步,分润比例还会提升。 对于趋境而言,这种模式不仅带来了稳定的现金流,更重要的是,它获得了大量真实的生产负载数据,这些数据反过来又能用于优化其ATaaS平台,形成“数据飞轮”。
客户画像与付费逻辑:
趋境科技的核心客户,并非那些“玩票”的创业公司,而是已经进入商业化阶段、对AI Token有刚性需求、且对成本极度敏感的企业级客户。例如,一家AI Coding公司,其用户每生成一行代码,都需要消耗Token。如果Token成本降低50%,其毛利率就能提升10个百分点,这直接决定了它的生死。因此,这类客户愿意为“更低成本、更高品质”的Token支付溢价。趋境的付费逻辑是“按量计费”或“按效果付费”,而非传统的“按GPU小时计费”。 这本质上是一种“风险共担、利益共享”的商业模式,将自身利益与客户的成功深度绑定。
四、 竞争格局:与巨头共舞,在缝隙中构建“精品专卖”
AI推理赛道,早已不是蓝海。趋境科技面临的竞争对手,既有来自云厂商的降维打击,也有来自AI Infra新贵的贴身肉搏。
1. 云厂商:AWS、Azure、阿里云、华为云
这些巨头拥有庞大的GPU集群、成熟的推理服务(如AWS SageMaker、阿里云PAI-EAS)以及强大的品牌效应。它们可以轻易地通过降价来挤压独立厂商的生存空间。然而,云厂商的推理服务存在一个致命弱点:它们是“大卖场”模式,追求模型兼容数量,而非单模型的极致效率。 它们需要支持数千种模型,导致其推理引擎(如TensorRT-LLM、vLLM)必须保持通用性,无法针对特定模型进行深度定制。而趋境科技的“少模型、深优化”策略,恰恰是反其道而行之。它只聚焦于头部10%的模型,通过深度定制Kernel、优化内存布局、甚至修改模型结构,将效率做到极致。 这种“精品专卖”模式,在单点效率上可以轻松超越云厂商的通用方案。
2. AI Infra新贵:Together AI、Fireworks AI、Anyscale(Ray)
这些硅谷明星公司同样聚焦于推理优化。Together AI主打开源模型的推理服务,Fireworks AI强调低延迟,Anyscale则提供分布式计算框架。与它们相比,趋境科技的差异化在于:更强调“系统级”而非“算法级”的优化。 Together AI的优化更多集中在KV Cache压缩、量化等算法层面;而趋境则深入到硬件层,通过“全系统异构协同”和“虚实同构”等技术,从存储、网络、计算等多个维度进行系统性优化。这就像F1赛车,Together AI优化的是发动机的燃油效率,而趋境科技优化的是整车的空气动力学、底盘悬挂和轮胎抓地力。
3. 国内同赛道:潞晨科技、清微智能、天数智芯
潞晨科技(Colossal-AI)同样出自清华,主打训练和推理的并行优化。但潞晨更偏向于“工具型”产品,提供开源框架;而趋境则更偏向于“服务型”产品,直接交付高品质Token。清微智能和天数智芯则是国产芯片厂商,它们更关注硬件层面的优化。趋境科技的优势在于,它不绑定任何特定硬件,可以灵活适配NVIDIA、AMD、以及国产芯片(如昇腾、寒武纪),从而在客户采购时提供“最优性价比”方案。这种“硬件中立”的定位,在国产替代浪潮中具有独特价值。
趋境科技的护城河,并非单一技术,而是一个由“系统架构能力+工程化经验+客户数据飞轮”构成的复合壁垒。 它不像OpenAI那样拥有模型算法优势,也不像英伟达那样拥有硬件生态优势,但它拥有的是“让任何硬件都能高效产出Token”的系统能力。这种能力,在AI基础设施走向同质化的今天,反而成为最稀缺的价值。
五、 投资逻辑:为什么是现在?为什么是趋境?
半年融资超10亿,老股东连续超额增投,这背后是投资人怎样的逻辑?
1. 宏观确定性:推理需求的指数级爆发
国家数据局的数据已经给出了最有力的证明:日均Token调用量突破140万亿。这背后是AI Coding(如Cursor、Copilot)、AI Agent(如AutoGPT)、AI搜索(如Perplexity)、以及企业级AI应用(如客服、营销)的全面爆发。当AI从“玩具”变为“工具”,推理需求就不再是线性增长,而是指数级增长。 投资人看到的是,一个万亿级的“Token经济”正在形成,而趋境科技是少数能够规模化生产“高品质Token”的工厂。
2. 微观稀缺性:清华HPC所的“降维打击”
AI Infra领域,最稀缺的不是算法人才,而是系统架构人才。清华HPC所,是中国计算机系统结构领域的“黄埔军校”。其团队成员对硬件底层、编译器、操作系统、分布式系统的理解,远超普通AI公司。这种“系统思维”是趋境科技最大的护城河。 投资人看中的,正是这种能够从底层硬件到上层应用进行全栈优化的能力。正如一位投资人所说:“我们投的不是一个AI公司,而是一个‘系统公司’,它用AI的方式重新定义了计算基础设施。”
3. 商业验证:从“故事”到“数字”
在A轮融资之前,趋境科技已经完成了商业闭环。2026年6月单月收入超过2025年全年,这证明了其商业模式的可复制性和可扩展性。投资人不再需要赌“技术是否可行”,而是可以计算“单位经济模型(UE)是否跑通”。 趋境科技的UE模型非常清晰:单台算力的Token产出效率提升3倍,意味着在相同硬件投入下,收入可以翻倍。这种“效率驱动”的增长,远比“烧钱换规模”的增长更健康。
4. 被低估的确定性:国产替代与智算中心“去库存”
随着美国对华芯片制裁的加剧,国产芯片(昇腾、寒武纪)的生态不完善,导致其推理效率远低于NVIDIA。趋境科技的“硬件中立”能力,恰好可以弥补这一短板。它能够通过系统优化,将国产芯片的推理效率提升到接近NVIDIA的水平,从而帮助智算中心“去库存”,盘活大量闲置的国产算力。 这是一个被市场严重低估的确定性机会。河南投资集团汇融基金的领投,也暗示了地方政府对“盘活本地算力资产”的强烈诉求。
六、 冷思考:技术壁垒的脆弱性与未来12-18个月的关键指标
尽管趋境科技前景光明,但我们不能忽视其面临的长尾风险。
1. 技术壁垒的脆弱性:英伟达的“降维打击”
英伟达的CUDA生态是其最大护城河。如果英伟达在下一代GPU(如Blackwell)中,直接内置了类似“以存换算”或“虚实同构”的硬件加速单元,那么趋境科技的软件优化优势将瞬间被抹平。这是所有AI Infra公司都面临的“天花板风险”:你的技术优化,本质上是在弥补硬件的不足;一旦硬件升级,你的价值就会贬值。 趋境科技能否与英伟达建立深度合作,或者转向更底层的硬件设计(如自研推理芯片),将是其长期生存的关键。
2. 市场假设的脆弱性:模型格局的收敛与颠覆
趋境科技的“少模型、深优化”策略,依赖于“头部模型格局稳定”的假设。如果未来出现一个“超级模型”(如GPT-5),其推理效率远超现有模型,导致所有下游应用都转向它,那么趋境科技之前针对其他模型的所有优化都将失效。此外,如果开源模型(如Llama 4)的性能追平甚至超越闭源模型,导致模型市场碎片化,那么“少模型”策略也将失去根基。
3. 商业模式的脆弱性:客户集中度与定价权
目前,趋境科技的收入高度依赖少数头部模型厂商。如果某一大客户选择自建推理基础设施(如字节跳动的“火山引擎”),或者转向云厂商的通用服务,趋境科技的营收将面临巨大波动。此外,随着市场竞争加剧,Token价格可能快速下跌,压缩趋境科技的利润空间。 它能否通过持续的技术迭代,保持成本优势,从而在价格战中存活下来,是商业上最大的不确定性。
4. 组织能力的挑战:从“技术极客”到“商业巨头”
趋境科技的团队以技术见长,但在规模化运营、销售、客户成功等方面,经验相对薄弱。随着业务爆发,如何快速组建一支千人级别的商业化团队,如何管理复杂的供应链(GPU采购、数据中心运维),如何应对来自大客户的定制化需求,都是巨大的组织挑战。总裁武文洁的加入,正是为了弥补这一短板,但效果仍需时间验证。
核心判断:趋境科技在AI推理效率优化上,已经建立了基于系统架构的短期护城河,其“Token即服务”的商业模式也初步跑通。然而,未来12-18个月,真正的考验在于:它能否在英伟达硬件迭代和模型格局变化中,持续保持效率领先;能否将客户从少数头部模型厂商扩展到更广泛的企业级市场;以及能否在融资热潮退去后,实现可持续的盈利。 关键观察指标包括:单台算力的Token产出效率是否持续提升(至少每季度提升50%)、非头部模型客户的收入占比是否超过30%、以及毛利率是否稳定在50%以上。如果这三个指标都能达标,趋境科技将有望成为AI基础设施领域的一个“隐形冠军”;否则,它可能只是这场Token战争中的一颗流星。
分类与标签
| 分类 | AI基础设施、企业服务、硬科技 |
|---|---|
| 标签 | AI推理, Token工厂, 清华系, 系统架构, 异构计算, 以存换算, 融资, 商业化, 国产替代 |
| 适合读者 | 科技投资人、AI创业者、企业CTO、技术决策者、行业分析师 |