2026年7月13日,位于加州伯林盖姆的AI芯片初创公司Quadric宣布完成其C轮融资的第二次交割,由世界银行旗下的国际金融公司(IFC)领投,将C轮总规模推高至4600万美元,公司累计融资达到9000万美元。这笔交易最引人注目的地方,并非金额本身——在AI芯片动辄数亿美元的融资热潮中,这只能算“中等体量”——而是投资方的身份:IFC首次涉足AI芯片投资,并且选择了一家专注于“边缘AI”而非云端训练的芯片IP授权商。IFC首席投资官Mohamed Eissa的发言揭示了背后的战略逻辑:“强大的AI不能继续成为超大规模云厂商的专属领地,如果新兴市场要缩小数字鸿沟的话。”这句话精准点中了当前AI产业最尖锐的结构性矛盾:一方面,大模型的能力以月为单位迭代,算力需求呈指数级增长;另一方面,全球绝大多数企业、政府和个人用户,却因为高昂的云端API调用成本、数据主权顾虑和网络延迟,被挡在AI应用的大门之外。Quadric的解决方案——一种可编程的“通用处理器IP”——试图在“专用芯片(ASIC)的高效率”和“通用芯片(CPU/GPU)的灵活性”之间找到第三条道路。这不仅是技术路线的选择,更是一场关于AI算力民主化的商业实验。

信息摘要表格

公司名称 Quadric Inc.
融资轮次 Series C 第二次交割(扩展轮)
融资金额 4600万美元(C轮总计),累计融资9000万美元
投资方 领投方:国际金融公司(IFC);跟投方:Pear VCUncork CapitalBEENEXT(均追加投资)、Offline Ventures(新进投资者)
官网 www.quadric.ai

行业痛点与底层逻辑

当模型进化以月计,芯片固化以年计

AI芯片行业正在经历一场“分裂”。在云端,英伟达的GPU凭借CUDA生态和H100/B200等专用硬件,几乎垄断了训练和推理市场,其市值一度突破3万亿美元。但在“边缘”——即手机、汽车、工业设备、机器人、可穿戴设备等非数据中心场景——情况截然不同。这里的算力需求同样爆炸式增长,但面临的约束条件却严苛得多:功耗预算通常只有几瓦到几十瓦,散热条件有限,实时性要求极高(例如自动驾驶的毫秒级响应),而且部署周期长达数年(汽车芯片的设计周期通常为3-5年)。更致命的是,AI模型本身正在以“月”为单位快速迭代。一个在2024年设计的NPU(神经网络处理器),其硬件架构在流片时就已经被锁定,但等到2025年甚至2026年产品上市时,它需要运行的可能是参数规模更大、计算模式完全不同的Transformer模型,甚至是VLA(视觉-语言-动作)世界模型。这种“硬件固化”与“软件进化”之间的时间错配,构成了边缘AI芯片行业最根本的痛点。

传统解决方案有两种:一是使用CPU或GPU等通用处理器,它们足够灵活,可以运行任何模型,但能效比极低——在边缘设备上,用CPU跑一个中等规模的LLM(大语言模型),功耗可能达到几十瓦,电池续航以分钟计算,且推理速度无法满足实时需求。二是使用专用的NPU或ASIC,它们针对特定模型(如ResNet、YOLO)进行极致优化,能效比可以比CPU高10-100倍,但一旦模型架构发生变化,这些芯片就会迅速贬值。一个典型的例子是:许多早期自动驾驶公司为Mobileye的EyeQ系列芯片编写了基于卷积神经网络的感知算法,但当Transformer架构(如Tesla的Occupancy Network)成为主流后,这些专用芯片无法高效运行新模型,导致车企不得不重新设计整个计算平台,成本以亿美元计。

这种“要么灵活但低效,要么高效但僵化”的二元困境,在AI模型进入“大模型时代”后变得更加尖锐。边缘设备需要运行的模型不再仅仅是几MB的图像分类网络,而是动辄数十亿参数的LLM(如Llama 3 8B、Phi-3)、多模态模型(如CLIP、LLaVA),以及未来的人形机器人所需的VLA世界模型。这些模型的参数量、计算模式和内存访问模式与传统的CNN截然不同:它们极度依赖矩阵乘法(GEMM)和注意力机制(Attention),需要巨大的片内SRAM和带宽,同时对精度要求(FP16/INT8)和稀疏性支持提出了新挑战。如果芯片公司继续沿用“为特定模型定制硬件”的思路,那么每一代新模型的出现,都意味着上一代芯片的淘汰——这种“硅谷折旧”的速度,已经超过了客户能够承受的财务周期。

Quadric的CEO Veerbhan Kheterpal用一句话概括了这个问题:“芯片的功能集在出货前几年就被锁定了,而AI模型每几个月就变一次。所以,一个以算子为中心的固定功能NPU,在模型发布时就已经落后,而且只会越来越落后。”这正是Quadric试图用“可编程通用处理器IP”来破解的难题。

技术创新与核心架构

它的芯片不是“造”出来的,而是“写”出来的

Quadric的技术核心是一套名为 Chimera GPNPU(通用可编程神经网络处理单元) 的处理器IP架构。这个名字本身就暗含了其设计哲学:GPNPU中的“G”代表“General-Purpose”(通用),试图将NPU从“专用加速器”的定位中解放出来,成为一种类似CPU但针对AI优化的通用计算单元。但实现这一目标的技术路径,与传统的NPU或GPU截然不同。

架构层面:从“算子硬连线”到“软件定义计算”

传统的NPU通常采用“数据流架构”:芯片内部包含一组固定的计算单元(如MAC阵列、向量单元),每个单元对应特定的AI算子(如卷积、池化、全连接)。当模型需要运行时,编译器将模型的计算图映射到这些固定单元上。这种设计的优势是效率极高——数据在芯片内的流动路径是预先设计好的,几乎没有冗余的指令开销。但缺陷同样明显:如果新模型引入了新的算子(如FlashAttention、Grouped Query Attention),或者改变了计算模式(如从密集矩阵乘法转向稀疏计算),这些固定单元就无法高效执行,甚至根本无法执行。

Quadric的Chimera架构则采取了截然不同的思路:它本质上是一个 “可编程的AI计算引擎” ,其核心是一个高度优化的、支持乱序执行的VLIW(超长指令字)处理器内核。这个内核并非为特定算子设计,而是提供了一套通用的计算原语(如向量MAC、非线性激活函数、数据重排、内存加载/存储),并通过一个强大的编译器将这些原语组合成任意AI算子的高效实现。换句话说,在传统NPU中,“算子”是硬件实现的;而在Chimera中,“算子”是软件实现的——编译器将模型中的每个算子(无论是卷积、Transformer注意力,还是自定义操作)编译成一系列VLIW指令,由处理器内核动态执行。

这种设计带来的核心优势是 “模型后向兼容性” 。Quadric的联合创始人兼首席产品官Daniel Firu解释道:“我们每发布一个新模型,就将其移植到Chimera内核上,然后客户通过软件更新就能获得对新模型的支持,无需更换芯片。这个移植引擎本身就是我们的产品:同一个内核可以运行在芯片设计完成多年后才发布的模型。”这意味着,汽车制造商在2024年流片的芯片,可以在2026年通过OTA更新获得运行Llama 3 70B的能力——这在传统NPU架构下是不可思议的。

软件栈:将AI模型“翻译”成C++

Quadric技术栈的另一大创新在于其软件工具链。传统AI芯片的软件栈通常包含一个编译器,将PyTorch/TensorFlow模型转换为芯片可执行的二进制代码。但Quadric的做法更进一步:它的编译器不是直接生成二进制指令,而是首先生成 C++代码。这意味着,SoC设计团队可以像编写普通嵌入式软件一样,使用Python或C++直接对Chimera内核进行编程,甚至可以对生成的C++代码进行手动优化和调试。这种“AI模型→C++→二进制”的编译流程,极大地降低了芯片设计公司采用Quadric IP的门槛——他们不需要理解复杂的AI编译器原理,只需要具备嵌入式C++开发能力即可。

此外,Quadric的软件工具链还支持 “动态图编译” 。对于传统NPU,模型通常需要在部署前进行静态图优化(如算子融合、内存规划),这导致模型更新需要重新编译和部署整个固件。而Chimera的VLIW架构允许在运行时动态加载新的计算图,使得模型更新可以像安装手机App一样简单——用户下载新的模型文件,系统自动编译并加载到处理器中,整个过程无需重启或重新烧录固件。

性能指标:从1 TOPS到3200 TOPS的可扩展性

Chimera架构的另一个关键特性是其 多芯片(multi-chiplet)可扩展性。单个Chimera内核的算力可以从1 TOPS(适用于可穿戴设备)扩展到超过3200 TOPS(适用于数据中心级边缘服务器),通过多芯片互联实现。这种可扩展性使得Quadric的IP可以覆盖从智能手表到自动驾驶汽车、从工业机器人到AI PC的广泛场景。更重要的是,这种扩展不是简单的“堆核”,而是通过统一的编程模型和内存一致性架构实现的:开发者编写的同一套AI模型代码,可以无缝地在不同规模的Chimera配置上运行,无需针对不同算力等级进行重新优化。

在具体实现上,Chimera内核针对Transformer模型进行了深度优化。它内置了高效的 稀疏计算支持(利用模型中的激活稀疏性来节省计算和带宽)、 混合精度计算(支持FP32/FP16/BF16/INT8等多种精度,并能在同一计算图中动态切换),以及 大容量片内SRAM(用于存储模型权重和中间激活,减少对外部DRAM的依赖)。这些特性直接回应了边缘LLM推理的核心挑战:内存带宽瓶颈和功耗限制。

商业模式与市场竞争

它不卖芯片,但每个芯片都要给它交“版税”

Quadric的商业模式是 IP授权(IP Licensing) ,这与Arm、Synopsys、Cadence等公司类似,而与英伟达、AMD、英特尔等芯片制造商截然不同。具体来说,Quadric将其Chimera GPNPU处理器IP授权给SoC(系统级芯片)设计公司,后者将Chimera内核集成到自己的芯片中,并支付前期授权费和基于芯片出货量的版税(royalty)。这种模式的优势在于:Quadric无需承担芯片制造、封装、测试和销售的巨大资本支出,而是通过“杠杆化”合作伙伴的产能和市场渠道来获取收入。对于客户而言,他们获得的是一个经过验证、可立即投产的AI加速器IP,无需自行组建数百人的AI芯片设计团队。

核心壁垒:软件生态与“时间差”

Quadric的核心壁垒并非硬件架构本身——虽然Chimera的设计确实精妙,但理论上其他公司也可以设计类似的可编程NPU。真正的护城河在于其 软件工具链和模型移植能力。正如Daniel Firu所言:“那个移植引擎就是我们的产品。”Quadric已经建立了一个专门的团队,持续跟踪最新AI模型(从Meta的Llama系列到Microsoft的Phi系列,再到Google的Gemma系列),并提前将它们移植到Chimera架构上。当客户需要支持一个新模型时,Quadric可以在几天内提供经过验证的软件包,而客户自己的团队可能需要数月时间。这种“模型就绪”能力,对于汽车(需要提前数年规划芯片功能)、AI PC(需要与Windows Copilot等生态对齐)和机器人(需要支持不断更新的VLA模型)等长周期行业至关重要。

此外,Quadric的IP授权模式还带来了 “网络效应” :随着越来越多的SoC设计公司采用Chimera架构,围绕该架构的软件生态(包括模型库、优化工具、调试工具)会越来越丰富,从而进一步降低新客户的采用成本。这与Arm的Cortex系列处理器IP的成功路径如出一辙。

市场竞争:与“专用派”和“通用派”的双线作战

Quadric面临的竞争来自两个方向:

  1. 专用NPU阵营:包括Arm的Ethos系列、Cadence的Tensilica系列、Synopsys的DesignWare ARC系列,以及众多初创公司(如Esperanto、Tenstorrent、Groq等)。这些公司的产品通常针对特定场景(如移动端、汽车、数据中心)进行极致优化,能效比极高,但灵活性不足。Quadric的差异化在于“可编程性”——当模型快速迭代时,专用NPU的硬件固化和软件适配周期会成为致命弱点,而Quadric的客户可以通过软件更新保持竞争力。
  2. 通用GPU/CPU阵营:包括英伟达的Jetson系列、AMD的Ryzen AI系列、英特尔的最新酷睿Ultra(集成NPU)等。这些产品依托庞大的软件生态(CUDA、ROCm、OpenVINO),在开发工具和社区支持方面具有压倒性优势。但它们的功耗和成本通常较高,且并非为边缘设备深度优化。Quadric的切入点在于“极致能效比”——在相同功耗预算下,Chimera内核可以提供比GPU高数倍的推理性能,同时保持CPU级别的灵活性。

财务表现与客户验证

Quadric声称,在C轮第一次交割(2026年1月)之前的一年里,其产品收入增长超过三倍,并实现了盈利。这是一个值得关注的信号:在AI芯片IP领域,实现盈利并非易事,因为前期研发投入巨大,而IP授权收入通常需要数年才能规模化。Quadric的客户名单覆盖了汽车(如TIER IV,一家日本自动驾驶公司)、AI PC(与英特尔、AMD的Copilot+ PC生态竞争)和企业级边缘设备。其“设计中标”(design win)数量正在快速扩大,这是IP授权公司最核心的业绩指标——每一个设计中标都意味着未来数年的版税收入流。

战略发展与关键挑战

它的未来取决于“下一个杀手级应用”何时到来

Quadric的未来12-18个月,将围绕三个关键里程碑展开:

1. 人形机器人:从“概念验证”到“量产落地”

Quadric在新闻稿中明确将“人形机器人”列为下一个重点市场。这并非偶然:人形机器人(如Tesla Optimus、Figure 01、1X Technologies的NEO)需要运行极其复杂的VLA世界模型,这些模型融合了视觉感知、语言理解和运动控制,对算力、功耗和实时性提出了前所未有的挑战。更重要的是,人形机器人的AI模型仍在快速进化中——目前没有哪个团队能确定2027年的主流模型架构是什么。这意味着,Quadric的“可编程性”优势在这个领域将得到最大程度的发挥。如果Quadric能在未来18个月内获得一至两家头部人形机器人公司的设计中标,其估值和收入将实现质的飞跃。

2. 新兴市场:IFC的“地缘政治”赌注

IFC的投资不仅是财务行为,更带有明确的地缘政治色彩。Mohamed Eissa指出:“新兴市场的中小企业现在可以在自己拥有的设备上部署AI,而无需支付按token计费的云账单。”这指向了一个巨大的潜在市场:印度、东南亚、非洲、拉丁美洲的数百万家企业,它们需要AI能力,但无法承担AWS或Azure的云端推理成本。Quadric的IP授权模式,使得当地芯片设计公司可以基于Chimera架构开发针对本地需求的AI芯片(例如用于农业检测、本地语言翻译、低成本的工业质检),从而绕开对西方云厂商的依赖。IFC的背书,将为Quadric打开这些市场的政府和企业客户渠道——这是任何纯商业VC都无法提供的资源。

3. 关键挑战:生态建设与竞争加剧

Quadric面临的最大挑战,并非技术本身,而是 生态建设。Arm之所以成功,是因为其Cortex系列IP拥有庞大的软件生态(包括操作系统、编译器、调试工具、第三方库)。Quadric目前虽然拥有强大的模型移植能力,但其开发者生态仍然相对薄弱——大多数AI开发者更熟悉CUDA或PyTorch,而非Quadric的C++编译流程。如果Quadric不能在未来12个月内显著降低开发者的学习成本(例如推出更高级的Python API、提供更丰富的模型示例库、建立活跃的开发者社区),其增长可能会被更“易用”的竞争对手(如英特尔的OpenVINO或英伟达的Jetson)所压制。

此外,竞争也在加剧。Arm正在加强其Ethos NPU的可编程性;RISC-V生态中出现了多款AI加速器IP;而英伟达的Jetson Orin系列已经将功耗降低到7W-15W区间,同时保持了CUDA生态的兼容性。Quadric需要证明,其“可编程性”带来的灵活性优势,足以抵消这些竞争对手在生态规模和品牌认知上的领先地位。

核心判断引用块

核心判断:Quadric的“可编程GPNPU”路线,精准命中了边缘AI芯片行业“硬件固化 vs 模型进化”的结构性矛盾,其IP授权模式更通过IFC的投资获得了进入新兴市场的战略通道。未来12-18个月的关键观察指标包括:人形机器人领域的设计中标数量、新兴市场(尤其是印度)的客户落地速度,以及其开发者生态的扩张能力。如果Quadric能在这三个维度中至少两个取得突破,它有望成为边缘AI芯片IP领域的“下一个Arm”;反之,它可能陷入“技术领先但生态薄弱”的尴尬境地,被拥有更庞大开发者基础的竞争对手边缘化。