当 DeepSeek、Kimi、GLM 等开源模型可以像下载应用一样获取权重,通用推理框架日渐成熟时,一种说法开始在业内流传:大模型推理正在变成一门“有卡就能干”的生意。但实际情况要残酷得多。在 AI 编程和办公智能体等真实业务场景中,企业客户对 Token 的要求远不止“能跑起来”这么简单。首 Token 延迟超过 3 秒,许多客户就已经无法容忍;突发的流量高峰中,一次接口失败就可能让 AI 工具被踢出核心工作流。

“模型能够运行,只代表生产出了 Token;能否在大规模并发下持续稳定地交付高质量 Token,才是真正的产品。”魔形智能创始人、CEO 徐凌杰对智东西说。他所描述的,是一个正在被资本重新定价的赛道——竞争焦点正从拥有多少张 GPU 卡,转向在相同成本、功耗和服务质量下,这些卡到底能稳定产出多少可销售的 Token。

2026 年 8 月 10 日,将自己定位为“Token 超级工厂”的魔形智能宣布完成 A 轮融资。本轮由毅达资本领投,诚元祥投资、洪山资本、瑞锋资本、南通产控思源人工智能基金、灏俊投资等联合投资,老股东达泰资本、香港科技园创投基金持续加注。南通产控思源人工智能基金由南通产控与上海交大菡源资产共同发起设立,这一背景也释放出地方产业资本与高校创新资源共同押注算力基础设施运营的信号。本轮融资金额未披露,资金将主要用于推进算力基础设施技术迭代与商业化落地。

字段 内容
公司 魔形智能
轮次 A轮
金额 未披露
投资方 毅达资本、诚元祥投资、洪山资本、瑞锋资本、南通产控思源人工智能基金、灏俊投资;老股东达泰资本、香港科技园创投基金
总部 上海
创始人 徐凌杰(CEO)、金琛(CTO)
官网 https://magikcompute.ai/

模型越开放,Token 交付能力就越成为稀缺资产

魔形智能本轮融资发生在一个关键节点:距离其 2026 年 5 月公布由达泰资本领投的数亿元 Pre-A 轮融资仅过去三个月。三个月内连续完成两轮融资,在当前环境下并不常见,更何况这家公司成立仅两年。但更不寻常的是其业务增速——魔形智能目前每天卖出的 Token 已经达到数万亿级,2026 年营收预计将达到数亿元,部分模型已经实现盈利。

这背后是一个正在被重新定义的市场。开源模型的密集发布实际上制造了一种新的瓶颈:模型本身的稀缺性正在消失,但稳定、高效、可大规模交付的 Token 供给依然稀缺。徐凌杰观察到,从行业公开数据和公司自身业务变化来看,推理需求的爆发已经成为国内外都较为确定的商业方向,而 Agent 对模型的高频、连续调用,又进一步放大了这种消耗。“如果没有这样的加速度,公司很可能会落后于市场。”他说。

对于投资人而言,赌注的逻辑正在发生变化。一家企业可以轻易下载开源模型权重,使用通用推理框架把它跑起来,但这离把 Token 稳定卖给大客户还有很远距离。“很多实验室里的优化可以宣称提升 40%、50%,甚至两三倍,但放到真实业务中未必能够落地。”CTO 金琛告诉智东西,“我们有客户和真实场景,可以直接找到最尖锐的问题,再用较小的代价解决它。”这正是魔形智能试图构建的差异化壁垒:它的技术迭代不来自实验室的理论推演,而是嵌入到客户真实业务中那些最尖锐的延迟、并发和稳定性问题里。

把 Token 当成产品卖,要解决的不只是“能跑起来”

魔形智能的客户及合作伙伴包括互联网头部企业、大模型厂商等大 B 客户,其 Token 已经进入部分企业的核心业务,主要覆盖 AI 编程、办公智能体等场景。科技互联网公司的核心生产力很大一部分来自开发者的编程工具和研发流程。Token 服务一旦嵌入其中,就等于直接支撑企业核心团队的日常生产。

但这种嵌入同时意味着极高的稳定性要求。AI 编程和白领办公场景的调用高峰高度集中在工作时间,一旦接口频繁失败,工具就难以真正进入工作流。响应速度同样关键。“首 Token 延迟超过 3 秒,很多企业客户已经难以接受。”金琛说。此外,P50 和 P99 延迟、KV Cache 命中率、并发吞吐、模型精度以及突发流量下的稳定性,都是客户评估供应商的核心指标。而在这些质量要求全部满足之后,“双方才会进一步谈性价比。”徐凌杰补充道。

这套指标体系构筑了一道隐形的产业门槛。以某些公开项目为参照,有人使用 80 张桌面显卡运行最新大模型,单路速度只能达到每秒 20 个 Token。模型虽然跑起来了,但速度难以满足商业场景要求,成本也无法支撑有竞争力的 Token 价格。在部分业务场景中,算力采购和运行成本可以占到 Token 总成本的八成甚至九成。选择哪种硬件运行哪种模型、怎样切分 Prefill 和 Decode 任务、如何提高单机吞吐和集群利用率,都直接决定毛利水平。模型调用率也会影响盈利,调用率高的模型可以充分利用算力,利用率低的模型则更容易形成闲置。这正是为什么简单采购硬件并部署通用框架往往难以盈利——Token 吞吐、响应延迟、稳定性和硬件成本需要被同时优化,它要求团队对芯片架构、系统软件和模型负载都有深入理解。

软硬协同的优化网络,从 KV Cache 调度到超节点架构

魔形智能的技术体系围绕 Prefill/Decode 分离、数据传输、内存管理、负载均衡、KV Cache 感知调度以及多硬件适配展开。不同模型的负载特征差异显著。有的模型更依赖显存带宽,有的更依赖计算能力;长输入短输出和短输入长输出的成本结构也完全不同,Decode 阶段通常更难提升利用率,短输入、长输出任务的单位成本往往更高。

魔形智能的 PD 分离方案可适配不同卡型和集群规模,调度系统结合 KV Cache 状态和实时负载分配请求,目标是尽可能提高缓存命中率。在长上下文和 Agent 任务中,大量输入内容会被重复使用。相比于每次重新计算,将高频内容写入缓存并提高命中率,可以显著降低算力消耗。

对客户而言,另一个关键变量是新模型的支持速度。客户不愿为一个模型同时接入大量供应商,因此供应商既要有足够大的初始容量,也要在需求突然上升时快速扩容。新模型发布后,魔形智能往往一至两天、甚至 Day0 就可以启动客户接入。在引入国产芯片时,团队会深入分析硬件架构、迁移算子并跑出性能,快速完成部署。公司已适配多家国产及海外芯片,同时与芯片厂商、AIDC、能源和冷却方案伙伴共同推进底层协同。

更具前瞻性的布局在超节点架构。随着模型参数和 Agent 任务复杂度增长,传统单机八卡服务器逐渐碰到显存容量和卡间通信瓶颈。超节点将更多 GPU 互联为一个更大计算域,但对故障容忍度提出了更高要求。传统八卡服务器中,一张卡故障影响范围通常局限在单台机器;到了数十卡乃至更大规模,一颗芯片发生故障可能干扰整个互联域,金琛将其称为更大的“爆炸半径”。魔形智能已围绕相关问题推出部分 PoC 产品,并在真实客户负载中持续验证。“要面向 Agent 场景做极致优化,超节点是必须研究的硬件平台。我们的目标是达到每秒千 Token。”金琛说。

资本押注的是有效产出率,而非理论算力规模

翻开本轮投资方名单,可以解读出几层信息。领投方毅达资本与联合投资方诚元祥投资、洪山资本、瑞锋资本、灏俊投资等,构成了一组财务资本与产业资源的组合。南通产控思源人工智能基金由南通产控与上海交大菡源资产共同发起设立,这意味着地方产控平台和高校创新资本正在将目光投向 Token 交付环节——这不再是单纯的算力叙事,而是将 AI 基础设施视为需要运营效率的实体产业。

老股东达泰资本和香港科技园创投基金持续加注,部分股东还进行了超比例跟投。徐凌杰描述,春节之后几个月里公司业务又向前跨了一步。“从 0 到 1,是用技术实力获得客户认可,把商业模式走通。从 1 到 10,是我们有了多个客户,并且能持续扩大产能、提高品质。”魔形智能从首批大客户拓展到多个客户,在同一客户内部又从单个模型延伸到多个模型、多个业务场景。随着算力投入增加,Token 销量和收入同步上升,并出现了部分模型盈利。投资人关心的核心问题,是这些算力能否按照客户质量和交付标准实现有效产出——不是部署完成后的理论产能,而是实际卖出并完成交付的 Token 数量。

这也解释了为什么“Token 工厂”能在 2026 年成为资本热点。从芯片厂商、云服务商到运营商和 AI 基础设施公司,几乎所有人都在讲 Token 工厂的故事,大额融资不断。但魔形智能的路径提供了一个具体参照:它已经将 Token 日销量推至数万亿级,并规模化进入头部客户的付费场景。虽然 A 轮融资金额未披露,但结合三个月前的数亿元 Pre-A 轮和本轮多家战略资源方的引入,可以推断其融资能力与业务扩张速度之间存在明显的正相关性。

资金将注入技术迭代,但规模化稳定交付才是真正的考验

根据公司披露,本轮融资将主要用于推进算力基础设施技术迭代与商业化落地。资金的一个核心流向是继续扩大可交付的产能。当日均产量从数万亿级向更高量级攀升,模型数量、硬件类型和客户负载将同步增加。硬件采购、互联、液冷和系统集成能力对 Token 成本的影响会进一步提高。

另一个方向是技术迭代。魔形智能需要在 Prefill/Decode 调度、KV Cache 策略和多硬件适配等环节持续优化,以维持并拉大与通用推理框架之间的效率差。徐凌杰对盈利预期保持乐观,他表示国产算力芯片、国产 AI 基础设施和国产大模型已经进入了需要全栈软硬件走向高效优化的阶段。注重资本效率、迅速实现自我造血,才有可能支撑起更大体量的商业目标。

但这套增长逻辑并非没有待验证的假设。第一个问题是客户集中度与扩展速度的匹配。魔形智能已进入部分互联网头部企业的核心业务,但大 B 客户的采购周期长、测试流程严苛。供应商通常要经过多轮测试才能进入正式生产环境,跨行业跨客户的复制速度将直接影响收入增速。

第二个问题是产能扩张与成本控制之间的平衡。当模型数量增多、硬件类型混杂,利用率较低的模型更容易形成闲置,而客户对响应速度的要求却不会降低——这要求调度系统在集群规模和异构性上升时仍然保持效率,否则将侵蚀部分模型已经实现的盈利。

第三个问题则来自竞争格局。芯片厂商、云服务商、运营商及其他 AI 基础设施公司纷纷布局 Token 工厂赛道,虽然魔形智能未披露具体的竞对名称,但这些玩家在算力资源、客户渠道或硬件生态上各具优势。能否在超节点和软硬协同优化上跑出可防御的技术代差,决定了其当前优势能否持续。

从拥有一张卡到产出一个有效 Token,产业链正在重新分工

魔形智能的创始团队背景,使它处在一个独特的交叉位置。徐凌杰过去 20 年经历了从英伟达、AMD 到阿里云 GPU 基础设施、壁仞科技的完整轨迹,长期处于芯片、系统和云计算的交接地带;金琛则拥有高性能计算、芯片软件栈和推理优化经验。这种组合让团队有能力跨越芯片选型、硬件采购、互联方案和系统集成等多个决策环节,这些环节对 Token 成本的影响会随着模型规模增长继续放大。

从产业链位置看,魔形智能试图占据的角色既不是算力租赁商,也不是大模型 API 平台,而是将芯片、系统软件和客户负载扭合在一起的那个优化层。它向芯片厂商提供真实负载反馈,向 AIDC 和能源冷却伙伴输出部署方案,同时向互联网和大模型客户交付经过质量验证的 Token。这种角色使它更接近一个“加工商”,原料是算力和模型权重,产品是可直接消费的智能。

这一定位也暗合了一个更宏观的趋势:Token 生产能力正在成为衡量每个国家 AI 产业发展水平和竞争力的关键指标。以前客户购买的是服务器、GPU 卡或算力集群,如今他们更希望直接获得可调用、可计量、质量稳定的 Token。评价一家 Token 工厂不再只是看它有多少张卡,而是看这些卡在相同成本、功耗和服务质量下,究竟能够生产出多少有效 Token。

魔形智能已经完成了第一阶段验证。但它面临的真正竞争才刚开始。当日均产量继续放大,当超节点架构进入规模化部署,当更多竞争者带着资本和硬件资源涌入,这家成立两年的公司需要证明的不仅是技术能跑通,而是工厂能在高负载、多模型、异构硬件和苛刻客户要求下,持续稳定地开转——让每一台机器持续产出可销售的智能。

RecodeX 极客视:开源模型把大模型推理的门槛降到“能跑起来”,但同时把真正的产业门槛推到了大规模生产级交付上。魔形智能目前拿到的牌不错——日销数万亿 Token、头部客户、三个月内两轮融资以及团队在芯片-系统-模型交叉领域二十年的积淀。接下来要看的是,当算力采购规模从数千张卡迈向更大数量级,当客户数量和模型种类同步膨胀,它能否在毛利率和服务质量之间维持住平衡。而更大的变量则来自竞争:当芯片厂商和云厂商同样以 Token 工厂逻辑重整自己的基础设施,魔形智能需要在超节点、软硬协同和交付效率上证明自己不是一个阶段性最优解,而是一个有壁垒的全新角色。

信息来源

本文在采集与核验阶段引用了以下公开来源,按站点去重列出;来源内容归原发布方所有,其口径不代表 RecodeX 的核实结论。