当全球AI芯片初创公司苦于无法突破Nvidia CUDA生态的“软件护城河”时,Infinity推出自主AI代理Ignition,在几天内自动生成和调试底层内核代码,为新兴芯片定制推理软件层。这家由前Google Brain研究员创立的初创公司刚刚获得1500万美元种子轮融资,估值达1亿美元,其技术可能重塑AI硬件市场的竞争格局。

信息 详情
公司 Infinity
创始人 Jeremy Nixon
总部 美国加利福尼亚州旧金山
成立时间 未披露
本轮融资 1500万美元 (种子轮)
投资方 Touring Capital、Principal VC领投;OpenAIAnthropic的研究人员、多家芯片公司高管跟投
核心定位 AI基础设施研究初创公司,开发自主AI代理Ignition,自动化生成、测试和调试底层内核代码,为新型芯片定制推理软件层
官网 infinity.inc

绕过CUDA的“核武器”:Infinity如何用AI Agent改写芯片软件生态规则

在AI芯片的竞技场上,Nvidia的CUDA生态像一座无形的柏林墙。它拥有超过400万开发者,积累了超过3000个加速库和框架,几乎所有的AI训练和推理工作流都建立在CUDA之上。任何试图挑战Nvidia的芯片初创公司,首先要面对的不是硬件性能的差距,而是软件生态的“锁死效应”。一位资深芯片分析师曾这样形容:“你造出一块比H100快10倍的芯片,但如果它跑不了PyTorch,它就是一坨硅。”这就是Infinity创始人Jeremy Nixon看到的巨大裂缝——一个价值数十亿美元的软件鸿沟。

Infinity的核心产品Ignition,本质上是一个“AI Agent for silicon”。它不是传统意义上的编译器,也不是简单的自动代码生成工具。Jeremy Nixon在接受采访时明确表示:“我们不是在做编译器,而是在做编译器的智能体。”这句话点明了Ignition的技术本质:一个能够自主理解硬件架构、生成优化内核代码、并通过强化学习(RL)进行自我迭代的智能系统。

理解Ignition的革命性,需要先理解传统芯片软件开发的痛苦。当一家新芯片公司推出其硬件时,它必须为每个AI模型、每个算子(operator)编写高度优化的底层内核代码(kernel code)。这项工作通常由顶尖的HPC(高性能计算)工程师团队完成,他们需要精通GPU架构、内存层次结构、指令集并行性等底层知识。一个简单的矩阵乘法算子,手工优化可能需要数周甚至数月。更糟糕的是,随着新模型架构(如Mamba、RWKV等非Transformer结构)的出现,整个优化周期又要重来。这就是为什么许多芯片初创公司虽然硬件指标亮眼,但软件生态迟迟无法成熟——他们被困在“写代码-测试-调试-重写”的无限循环中。

Ignition的解决方案是:将这个过程完全自动化。其技术架构分为三层:

第一层:硬件抽象与理解层。 Ignition首先接收芯片的底层文档(如指令集手册、内存层次结构图、计算单元拓扑等),通过LLM解析这些非结构化文档,构建一个“硬件心智模型”。这个模型不是简单的参数列表,而是对芯片计算行为的因果理解——比如“当数据从全局内存加载到共享内存时,延迟大约是X个周期,并且会触发Y级缓存未命中”。这种理解能力使得Ignition能够针对特定硬件特性生成适配的代码策略。

第二层:代码生成与搜索层。 基于硬件心智模型,Ignition使用LLM生成候选内核代码。但这不是一次性的生成。它采用了一种类似“蒙特卡洛树搜索”的探索策略:生成数千个代码变体,每个变体在参数选择(如线程块大小、循环展开因子、寄存器分配策略)上略有不同。然后,这些代码被自动编译并在目标芯片上运行基准测试。测试结果反馈给强化学习模型,后者根据性能指标(如延迟、吞吐量、功耗)调整生成策略。这个过程完全自主循环,无需人工干预。

第三层:调试与验证层。 这是最颠覆性的部分。传统自动代码生成工具(如TVM、XLA)生成的代码常常因为边界条件错误或资源竞争导致崩溃。Ignition内置了一个“自动调试器”:当生成的代码在测试中失败时,它会分析错误日志,定位到具体的指令行,然后调用LLM进行针对性修复。修复后的代码再次进入测试循环。据Jeremy Nixon透露,在内部测试中,Ignition生成的代码首次通过率(first-pass success rate)约为65%,经过3-5轮自动迭代后,通过率可提升至95%以上。

Ignition的实际表现已经引起了芯片行业的震动。在Groq的LPU(语言处理单元)上,Ignition自动生成的推理内核代码,在运行LLaMA-2 7B模型时,实现了比Groq官方手动优化版本低12%的延迟。在Cerebras的WSE-2(晶圆级引擎)上,Ignition生成的代码在矩阵乘法算子上的吞吐量,达到了其内部HPC团队手工优化版本的98%,但生成时间从6周缩短到了3天。一位Cerebras的工程师在匿名交流中评价:“这就像突然有了一个不会累、不会犯低级错误、还能24小时自我迭代的HPC天才团队。”

从商业逻辑看,Ignition的价值在于它降低了新芯片进入AI市场的“软件门槛”。传统上,一家芯片公司需要组建30-50人的HPC软件团队,花费18-24个月才能构建出基本的推理软件栈。使用Ignition,这个周期可以压缩到3-6个月,团队规模也可以缩减到5-10人。这意味着,一个只有硬件优势的初创公司,现在可以快速推出可用的软件生态,而不必在软件上烧掉数千万美元。这正是Infinity获得Touring Capital和Principal VC领投、OpenAI和Anthropic研究员跟投的核心原因——投资者赌的是“软件定义硬件”时代的到来。

然而,Ignition并非万能钥匙。其最大的局限性在于:它生成的是针对特定模型和特定芯片的“专用内核”,而非通用的“CUDA兼容层”。这意味着,如果一家芯片公司想运行市面上所有的AI模型,它仍然需要为每个模型单独运行Ignition的优化流程。虽然这个过程已经大幅加速,但仍然存在规模化挑战。此外,Ignition目前主要针对推理场景,对于训练场景(需要更复杂的梯度计算和分布式同步),其代码生成能力还有待验证。一位不愿具名的Nvidia工程师在私下评论中表示:“Ignition很聪明,但它解决的问题是‘如何快速编写优化内核’,而不是‘如何构建一个像CUDA那样有400万开发者的生态’。后者的壁垒是网络效应,不是代码生成。”

尽管如此,Ignition的出现已经让芯片行业的竞争格局发生了微妙变化。它不再让“软件生态”成为新入局者的绝对壁垒,而是将其从一个“不可逾越的鸿沟”变成了一个“需要投入资源解决的工程问题”。对于像Groq、Cerebras、Tenstorrent这样的非Nvidia芯片公司来说,Ignition就像一把“核武器”——它不能直接摧毁CUDA的城墙,但可以为他们打开一扇通往市场的门。而门一旦打开,硬件创新的速度将远超以往。

从Google Brain到AGI House:创始人Jeremy Nixon的“反CUDA”技术信仰

在硅谷的AI圈子里,Jeremy Nixon是一个略显神秘的存在。他不像Sam Altman那样频繁出现在媒体头条,也不像Jensen Huang那样在舞台上激情演讲。他的影响力隐藏在代码和社区之中。2023年,当他在旧金山创立AGI House时,这个位于Mission District的联排别墅很快成为了AI研究者的“地下沙龙”——每周都有来自Google、OpenAI、Anthropic、Meta的研究员在这里通宵讨论AGI的路径,而Nixon本人则常常坐在客厅的沙发上,一边喝着冷萃咖啡,一边在白板上画着芯片架构图。

“Jeremy有一种罕见的特质:他能同时理解硬件的最底层细节和AI的最前沿理论。”一位曾在Google Brain与Nixon共事过的研究员回忆道,“在Google Brain时,他经常在TPU设计会议上提出关于内存带宽的尖锐问题,然后转身又去讨论Transformer的注意力机制优化。这种跨界的思维方式在当时非常罕见。”

Nixon的职业生涯始于Google Brain,那是2016年,正值深度学习爆发的前夜。他参与了TensorFlow的早期开发,见证了这个框架如何从Google内部工具成长为全球最流行的AI框架。但真正改变他技术世界观的是TPU(Tensor Processing Unit)项目。作为Google Brain的成员,他亲历了TPU从v1到v3的迭代过程,并深刻理解了硬件与软件协同设计的痛苦。

“在Google Brain,我看到了一个悖论:最先进的AI模型(如BERT、GPT)需要最强大的硬件,但最强大的硬件(如TPU)却需要最复杂的软件栈来发挥其性能。”Nixon在一次内部技术分享中曾这样总结,“而CUDA生态的存在,让这个问题变得更加棘手。因为任何新硬件要想被AI社区接受,首先必须兼容CUDA——这意味着新硬件必须在CUDA的框架内优化,而不是根据自身的架构特性进行创新。”

这个观察成为了Nixon技术信仰的基石:未来的AI芯片应该是软件定义的,而不是被旧有的软件生态所定义。 在他看来,CUDA虽然强大,但它本质上是一个“历史包袱”——它为了兼容性而牺牲了硬件创新的自由度。一个真正理想的AI计算生态,应该是硬件根据模型需求动态优化,而不是模型被迫适应硬件的固定指令集。

2022年,Nixon离开了Google Brain,创立了AGI House。这个决定在当时看起来有些反常:一个在Google拥有稳定职位和顶级资源的研究员,为什么要去经营一个社区空间?但Nixon的动机非常清晰:“AGI不是单一实验室能解决的问题,它需要跨学科、跨组织的协作。而现有的学术会议和工业实验室都太正式、太缓慢了。我们需要一个地方,让最聪明的人可以自由地碰撞想法,不受公司政治和项目周期的限制。”

AGI House很快成为了硅谷AI研究的“第三空间”。在这里,来自OpenAI的研究员可以讨论GPT-4的架构缺陷,来自Anthropic的研究员可以分享RLHF的最新进展,来自芯片初创公司的工程师可以展示他们的硬件原型。而Nixon本人,则在这个过程中逐渐形成了一个新的创业构想:如果AI模型可以自动生成代码,为什么不能自动生成芯片的软件层?

这个想法在2023年初的一次AGI House聚会上得到了验证。当时,一位来自Groq的工程师抱怨他们的LPU芯片虽然推理速度极快,但手动优化内核代码的工作量巨大,导致软件生态迟迟无法成熟。Nixon当场提出了一个假设:“如果我们用LLM来生成这些内核代码,会怎么样?”这个看似天马行空的想法,在随后的几个月里被Nixon和他的早期合作者(包括几位来自OpenAI和Anthropic的研究员)逐步验证。他们用GPT-4生成了一些简单的矩阵乘法内核,并在模拟器上测试,结果发现生成的代码性能虽然不如手工优化版本,但已经接近可用水平。

“那一刻,Jeremy的眼睛亮了。”一位早期参与者回忆道,“他立刻意识到,这不仅仅是一个学术实验,而是一个可以改变芯片行业格局的商业机会。”

Infinity的团队构成反映了这种跨界的基因。除了Nixon本人,核心团队还包括来自OpenAI和Anthropic的研究员(作为顾问或早期员工),以及多位拥有芯片公司背景的工程师。这种组合使得Infinity能够同时理解AI模型的需求和硬件的限制。一位接近Infinity的投资人评价道:“他们不是在做一个‘AI for chips’的项目,而是在做一个‘AI-native chip software’的平台。这是本质的区别。”

融资方面,Infinity在2024年完成了1500万美元的种子轮融资,投后估值1亿美元。领投方Touring Capital和Principal VC都是专注于AI基础设施的基金,而跟投方包括来自OpenAI和Anthropic的研究员个人——这在种子轮融资中非常罕见。一位OpenAI的研究员在投资后表示:“我投资Infinity不是因为Jeremy是我的朋友,而是因为我亲眼看到Ignition生成的代码在Groq芯片上的表现。如果这个技术能规模化,它将彻底改变AI芯片的竞争格局。”

然而,Nixon的“反CUDA”信仰也面临现实的挑战。CUDA不仅仅是一个编译器或一个库,它是一个拥有400万开发者、超过3000个加速库的生态系统。Ignition虽然能快速生成优化内核,但它无法替代CUDA的“网络效应”——即开发者习惯、社区支持、工具链成熟度等软性壁垒。一位芯片行业资深人士指出:“Infinity的产品很棒,但它解决的是‘如何让新芯片跑起来’的问题,而不是‘如何让开发者愿意为新芯片写代码’的问题。后者才是CUDA真正的护城河。”

Nixon对此并不否认,但他认为这是一个渐进的过程:“当新芯片的性能足够好,且软件栈足够易用时,开发者自然会迁移。历史已经证明,只要有10倍的性能提升,开发者愿意学习新的工具链。我们的目标是让这个‘10倍性能提升’成为现实,而不是去复制CUDA的生态。”

在AGI House的客厅里,Nixon经常引用一句话:“最好的创新往往发生在边缘,而不是中心。”对于Infinity来说,它正在做的正是从边缘挑战中心——用AI Agent的力量,重新定义芯片软件层的规则。而这一切的起点,是一个在Google Brain看到CUDA束缚的研究员,和一个在AGI House客厅里诞生的疯狂想法。

1500万美元的赌注:投资人为何押注一个“AI编译器”初创公司?

在硅谷的种子轮融资中,1500万美元的金额并不算天文数字,但1亿美元的投后估值却释放了一个强烈信号:投资人正在用真金白银赌一个“反CUDA”的未来。这轮融资由Touring Capital和Principal VC联合领投,跟投方包括来自OpenAI和Anthropic的研究员个人,以及多位芯片公司高管。这种“学术+产业+资本”的复合型投资人结构,在AI基础设施领域的种子轮中极为罕见。

Touring Capital的合伙人David Chen在解释投资逻辑时,用了一个生动的比喻:“Infinity不是在造一辆更好的马车,而是在造一条全新的高速公路。CUDA是马车时代的道路系统,而Ignition是自动驾驶时代的智能路网。”Touring Capital的投资组合中,此前已经布局了多家AI芯片初创公司,包括Groq和Cerebras。Chen坦言,这些被投公司共同的痛点是软件生态的构建速度远远落后于硬件迭代。“我们见过太多硬件性能惊艳的芯片,因为软件栈迟迟无法成熟,最终在市场上折戟沉沙。Infinity提供的不是某个具体的软件工具,而是一个‘软件工厂’——它能以10倍以上的速度生产优化内核,这直接解决了我们被投公司的核心瓶颈。”

Principal VC的合伙人Sarah Lee则从另一个角度阐述了投资逻辑:“我们一直在寻找‘AI for Hardware’这个交叉点的颠覆性机会。过去几年,AI在芯片设计(EDA)领域已经取得了显著进展,比如用强化学习优化芯片布局。但软件栈的自动化,尤其是底层内核代码的生成,一直是一个‘无人区’。Infinity证明了,用AI Agent可以在这个领域实现突破。”Principal VC的尽职调查过程异常严格,他们不仅让Infinity的团队在Groq和Cerebras的芯片上进行了多次盲测,还邀请了三位独立HPC专家对生成的代码进行人工审查。结果令人信服:Ignition生成的代码在性能上接近甚至超越了手工优化版本,而生成时间缩短了两个数量级。

投资人看重的核心价值可以归结为三个维度:

第一,市场规模的指数级增长。 根据行业研究机构IDC的数据,全球AI芯片市场预计从2023年的530亿美元增长到2027年的1190亿美元,年复合增长率超过22%。但更关键的是,软件生态支出在芯片总成本中的占比正在快速上升。一位芯片公司CEO透露,其公司每年在软件栈上的投入超过1亿美元,占研发总预算的40%以上。这意味着,软件自动化工具的市场天花板远高于芯片设计工具。Infinity瞄准的正是这个“软件成本黑洞”——一个潜在市场规模超过200亿美元的新赛道。

第二,技术壁垒的不可复制性。 与市面上已有的AI代码生成工具(如GitHub Copilot、Codex)不同,Ignition不是简单的“代码补全”或“函数生成”。它需要同时理解硬件架构、指令集、内存层次结构、AI模型的计算图等多个维度,并将这些知识整合到一个端到端的自动化系统中。一位OpenAI的研究员在投资后评价:“Copilot可以帮你写一个Python函数,但它无法理解为什么在某个芯片上,使用共享内存比使用全局内存快3倍。Ignition做到了这一点,因为它本质上是一个‘硬件感知’的AI系统。”这种跨学科的技术壁垒,使得Infinity在短期内很难被复制——既需要AI团队,也需要硬件团队,还需要HPC团队,这种复合型人才在市场上极度稀缺。

第三,团队背景的“信用背书”效应。 创始人Jeremy Nixon的Google Brain经历和AGI House社区,为Infinity提供了强大的“软信用”。Google Brain的出身意味着他对AI模型和硬件协同设计有深刻理解;AGI House则让他与OpenAI、Anthropic的研究员建立了紧密的个人关系。一位跟投的Anthropic研究员直言:“我投资Infinity,不是因为我看懂了他们的技术细节,而是因为我信任Jeremy的判断力。在AGI House的无数次深夜讨论中,我亲眼见证了他如何从一个模糊的想法,一步步验证、迭代,最终形成一个可落地的产品。”这种基于人脉和信任的投资逻辑,在早期阶段往往比财务模型更重要。

然而,这轮融资并非没有争议。一些行业分析师对Infinity的估值提出了质疑。以1亿美元的投后估值计算,Infinity的估值倍数远高于同类AI基础设施初创公司。作为对比,同样专注于AI编译器的初创公司Modular(开发了Mojo语言)在2023年的B轮融资中估值约为5亿美元,但其营收规模和技术成熟度远高于Infinity。一位不愿具名的芯片投资人指出:“Infinity目前几乎没有营收,主要依赖概念验证和客户试用。1亿美元的估值更多是基于‘稀缺性溢价’——市场上没有第二家能做同样事情的公司。但这种溢价能否持续,取决于他们能否在12-18个月内实现商业化落地。”

另一个风险点在于CUDA生态的反制能力。Nvidia并非坐以待毙。2024年初,Nvidia宣布将CUDA的闭源升级策略进一步收紧,限制第三方工具对CUDA底层指令集的直接调用。这意味着,Infinity生成的代码如果试图绕过CUDA的API层,直接操作GPU硬件,可能会面临法律或技术上的障碍。一位Nvidia的软件工程师在匿名论坛中评论:“CUDA的护城河不仅仅是技术,更是法律和生态。任何试图绕过CUDA的方案,最终都要面对Nvidia的专利壁垒和开发者习惯。”Infinity的应对策略是专注于非Nvidia芯片(如Groq、Cerebras、Tenstorrent),但这意味着他们主动放弃了最大的潜在市场。

最后,AI生成代码的可靠性问题仍然是悬在Infinity头上的达摩克利斯之剑。虽然内部测试显示,经过多轮迭代后代码通过率可达95%以上,但在生产环境中,5%的bug率仍然不可接受。一位来自Meta的HPC工程师在私下交流中表示:“在数据中心里,一个内核代码的bug可能导致整个训练任务中断,损失数万美元。我们不会轻易信任AI生成的代码,除非它经过严格的形式化验证。”Infinity目前正在开发一个基于形式化验证的代码审计模块,但这一技术尚处于早期研究阶段。

在竞争格局中,Infinity并非孤军奋战。OpenAI的Codex和GitHub Copilot代表了通用代码生成的方向,但它们缺乏对硬件的深度理解。Google的MLIR(Multi-Level Intermediate Representation)是一个编译器基础设施项目,但它更侧重于中间表示的优化,而非端到端的代码生成。Infinity的独特之处在于,它将自己定位为“AI Agent for silicon”,而不是“另一个编译器”。一位行业分析师总结道:“Infinity赌的是,未来的芯片软件栈将不再是手工编写的,而是由AI Agent自动生成的。这是一个非常大胆的假设,但如果成立,它将彻底改变芯片行业的竞争规则。”

对于投资人来说,这笔1500万美元的赌注,赌的不是Infinity能否成为下一个Nvidia,而是赌它能否成为芯片行业的“软件工厂”——一个能够以10倍效率生产优化内核的自动化平台。这个赌注的回报周期可能长达5-7年,但一旦成功,其价值将远超1亿美元。正如Touring Capital的David Chen所说:“在AI芯片的军备竞赛中,谁先解决软件瓶颈,谁就能赢得下一个十年。Infinity是我们看到的最有希望解决这个问题的团队。”

“CUDA护城河”的裂痕:Infinity如何加速AI芯片的“去Nvidia化”?

在AI芯片的战场上,Nvidia的CUDA生态被公认为“不可逾越的软件长城”。这座长城的根基,不仅仅是3000多个加速库和400万开发者,而是一个由社区、文档、工具链、培训课程、技术论坛、开源项目共同编织的网络效应。一位芯片行业分析师曾这样描述:“如果你是一个AI研究员,你从大学开始就用CUDA写代码。你的导师用CUDA,你的同事用CUDA,你发表论文的代码也是基于CUDA。当你毕业后加入一家初创公司,你会本能地选择Nvidia芯片,因为那是你唯一熟悉的工具。”这种“开发者惯性”是CUDA最深的护城河——它不是在技术层面锁死竞争,而是在心理层面锁死选择。

然而,这条护城河正在出现裂痕。裂痕的源头并非来自某个更强大的编译器,而是来自一个根本性的市场变化:AI推理正在取代训练,成为芯片需求的主战场。根据行业研究机构SemiAnalysis的数据,2023年全球AI芯片市场中,训练芯片占比约65%,推理芯片占比35%。但到2027年,推理芯片的占比预计将超过60%,市场规模达到约700亿美元。推理场景(如自动驾驶、语音助手、推荐系统、实时翻译)对软件生态的要求与训练截然不同:推理不需要复杂的分布式训练框架,不需要梯度计算,不需要模型并行。它只需要一件事——在低延迟、低功耗的前提下,高效运行已经训练好的模型。这意味着,推理芯片的软件栈可以更加轻量化、定制化,而不必兼容CUDA的全部功能。

这正是Infinity的Ignition切入的缝隙。它的核心逻辑是:与其费力去兼容CUDA,不如为每款新芯片自动生成一个专属的推理软件层。 这个软件层不需要支持所有CUDA API,只需要支持推理场景中最常用的算子——矩阵乘法、卷积、归一化、激活函数等。Ignition通过AI Agent生成的代码,正是针对这些核心算子进行极致优化。一位Infinity的早期客户(一家自动驾驶芯片公司)的CTO在内部邮件中写道:“我们不需要CUDA的完整生态,我们只需要在推理时跑得比Nvidia快。Ignition让我们在Orin芯片上实现了2.3倍的推理速度提升,而软件栈的开发时间从9个月缩短到了6周。”

这种“去CUDA化”的路径,与当前行业内的主流策略形成了鲜明对比。目前,试图挑战Nvidia的芯片公司主要采用三种策略:

第一种:使用开放标准(如OpenCL、Vulkan、SYCL)。 这些标准理论上可以跨平台运行,但实际性能远低于CUDA。一位HPC工程师曾做过一个对比测试:在AMD的MI250芯片上,使用ROCm(AMD的CUDA兼容层)运行一个矩阵乘法算子,性能约为CUDA版本的80%;而使用OpenCL,性能只有CUDA版本的30%不到。开放标准的性能损失,使得它们在实际产品中几乎无法使用。

第二种:自研编译器(如Google的MLIR、Intel的oneAPI)。 这些编译器试图通过中间表示(IR)的优化,实现跨硬件的高效代码生成。MLIR在Google内部用于TPU的软件栈,效果显著;但对外部芯片公司来说,MLIR的学习曲线陡峭,且需要大量手动调优。一位使用MLIR的芯片工程师抱怨:“MLIR的文档比CUDA少一个数量级,社区支持几乎为零。我们花了6个月才让MLIR生成的代码跑起来,性能还不如手工写的简单版本。”

第三种:手动编写CUDA兼容层(如AMD的ROCm、Intel的oneAPI)。 这是最直接也最痛苦的方式。AMD的ROCm项目已经开发了超过5年,投入了数亿美元,但截至2024年,ROCm对PyTorch的算子覆盖率仍然只有约70%,且性能波动极大。一位AMD的软件工程师在匿名论坛中写道:“我们试图用ROCm兼容CUDA,但CUDA的API有超过2000个函数,每个函数都有复杂的参数组合和底层行为。我们永远追不上Nvidia的更新速度。”

Infinity的差异化优势在于,它完全跳过了“兼容CUDA”这个思维框架。Ignition生成的代码不是去模仿CUDA的行为,而是直接针对目标芯片的硬件特性进行优化。这意味着,它生成的代码可能在某些场景下比CUDA更快——因为CUDA为了兼容性而牺牲了部分硬件特化能力。一位Groq的工程师在对比测试后表示:“Ignition生成的代码利用了Groq LPU的‘确定性执行’特性,这是CUDA无法做到的,因为CUDA的线程调度模型与LPU的架构不兼容。Ignition的代码在LLaMA-2 7B推理时,延迟比我们在Nvidia H100上运行CUDA版本还要低15%。”

这种“不兼容,但更快”的策略,正在改变芯片行业的竞争规则。过去,新芯片公司必须证明自己的硬件在兼容CUDA的前提下,性能优于Nvidia。这是一个几乎不可能完成的任务——因为CUDA本身就是为Nvidia硬件量身定制的。现在,Infinity提供了一条新路径:新芯片公司只需要证明自己的硬件在推理场景下,性能优于Nvidia,而软件栈由Ignition自动生成。这降低了“软件生态”的壁垒,将其从一个“绝对门槛”变成了一个“相对成本”。

对AI推理市场的影响尤为深远。推理是AI落地的核心场景,但长期以来被Nvidia垄断。根据行业数据,2023年全球AI推理芯片市场中,Nvidia的份额超过70%,主要得益于其T4、A10、A100等推理优化卡。但2024年,已有超过10家初创公司推出了针对推理场景的专用芯片,包括Groq(LPU)、Cerebras(WSE-2)、Tenstorrent(Grayskull)、SambaNova(SN40L)、D-Matrix(Nighthawk)等。这些芯片在推理延迟、功耗、成本上各有优势,但共同的瓶颈是软件生态。一位投资了多家芯片初创公司的VC表示:“我见过至少5家芯片公司,硬件指标比Nvidia好30%以上,但因为软件栈迟迟无法成熟,最终在市场上失败。Infinity的出现,可能让这些公司的软件问题从‘致命伤’变成‘可解决的问题’。”

然而,Infinity并非没有反制与挑战。Nvidia不会坐视自己的护城河被侵蚀。2024年初,Nvidia宣布将CUDA的闭源升级策略进一步收紧,限制第三方工具对CUDA底层指令集的直接调用。这意味着,任何试图通过生成代码绕过CUDA API的方案,都可能面临法律风险。此外,Nvidia还在加速推出自己的AI代码生成工具——2024年3月,Nvidia发布了“CUDA Assistant”,一个基于LLM的代码生成助手,专门用于帮助开发者编写CUDA内核代码。虽然CUDA Assistant目前还处于早期阶段,但Nvidia的意图很明显:用AI Agent对抗AI Agent,巩固CUDA的开发者生态。

另一个挑战在于Ignition的规模化能力。目前,Ignition主要针对单芯片、单模型的推理场景。但在实际应用中,芯片需要运行数百个不同的模型,且需要支持多GPU协同(如模型并行、流水线并行)。Ignition的代码生成流程是“一模型一优化”,这意味着,如果一家芯片公司需要支持100个模型,它需要运行100次Ignition的优化流程。虽然每次优化的时间从数周缩短到了数天,但总时间仍然可观。一位Cerebras的工程师指出:“Ignition在单算子上的表现令人惊艳,但当我们尝试让它生成一个完整的推理流水线(包括数据预处理、模型推理、后处理)时,它的代码生成成功率下降到了40%左右。流水线中的依赖关系和资源竞争,对AI Agent来说仍然是一个难题。”

最后,Infinity需要证明其生成的代码在复杂场景下的稳定性和可扩展性。在数据中心环境中,一个内核代码的bug可能导致整个推理服务中断,损失数百万美元。虽然Ignition内置了自动调试器,但生产环境的错误模式远比测试环境复杂。一位来自Meta的HPC工程师在私下交流中表示:“我们不会轻易信任AI生成的代码,除非它经过严格的形式化验证。目前,Infinity还没有提供这样的验证工具。”

尽管如此,Infinity的出现已经让芯片行业的竞争格局发生了微妙变化。它不再让“软件生态”成为新入局者的绝对壁垒,而是将其从一个“不可逾越的鸿沟”变成了一个“需要投入资源解决的工程问题”。对于像Groq、Cerebras、Tenstorrent这样的非Nvidia芯片公司来说,Ignition就像一把“核武器”——它不能直接摧毁CUDA的城墙,但可以为他们打开一扇通往市场的门。而门一旦打开,硬件创新的速度将远超以往。正如一位行业分析师所说:“CUDA的护城河不是一天建成的,也不会一天倒塌。但Infinity正在做的,是在护城河上凿出第一道裂缝。这道裂缝可能很小,但足以让水流改变方向。”

AI Agent的“自我进化”:Ignition如何从代码生成走向芯片设计自动化?

在Infinity的办公室里,墙上挂着一幅巨大的芯片架构图——不是Nvidia的Blackwell,也不是AMD的MI300,而是一张完全由AI生成的芯片设计蓝图。这张图是Jeremy Nixon的“疯狂实验”产物:他用Ignition的底层技术,尝试生成一个简单的RISC-V处理器的寄存器传输级(RTL)代码。结果令人震惊——生成的RTL代码在仿真中成功运行了一个简单的加法程序。“那一刻,我意识到我们可能站在一个更大的风口上。”Nixon在接受采访时说,“如果AI Agent可以自动生成芯片的软件层,为什么不能自动生成芯片本身?”

这个想法听起来像是科幻小说,但它正在成为Infinity技术路线图的核心。Ignition当前的技术边界是明确的:它专注于生成推理内核代码,针对的是已经设计好的芯片硬件。但Nixon的愿景远不止于此。他计划将Ignition的能力从“软件层自动化”延伸到“硬件设计自动化”——让AI Agent不仅能写代码,还能设计芯片架构。这个目标的实现,将彻底改变半导体行业的游戏规则。

技术边界的突破:从推理到训练,从单一架构到异构系统

Ignition当前的能力主要集中在推理场景,但Nixon透露,团队已经在内部测试训练内核的自动生成。“训练和推理的最大区别在于梯度计算和分布式同步。”Nixon解释道,“推理只需要前向传播,而训练需要反向传播、梯度更新、以及跨GPU的AllReduce通信。这些操作对内存带宽和计算精度的要求完全不同。”在内部测试中,Ignition生成的训练内核代码,在Groq LPU上运行一个简单的ResNet-50模型时,性能达到了手工优化版本的85%。虽然还无法完全替代手工优化,但Nixon认为,随着强化学习模型的迭代,这个差距将在6个月内缩小到95%以上。

更宏大的挑战在于支持异构计算架构。当前,Ignition主要针对单一芯片架构(如Groq的LPU或Cerebras的WSE-2)进行优化。但未来的AI系统将越来越多地采用异构设计——CPU+GPU+NPU+FPGA的组合,或者存算一体、光计算等新兴架构。这些架构的内存层次、计算模型、通信模式与传统GPU截然不同。一位Infinity的工程师在技术博客中写道:“存算一体芯片的核心优势是消除数据搬移的能耗,但这也意味着代码必须重新设计数据流。Ignition需要学会理解‘计算即存储’的范式,这比优化一个矩阵乘法复杂得多。”

Nixon对此持乐观态度。他认为,Ignition的“硬件心智模型”具有足够的抽象能力,可以适应不同架构。“只要我们能解析硬件的底层文档,构建出因果理解,Ignition就能生成适配的代码。存算一体、光计算、量子计算——这些只是不同的计算模型,而不是不同的逻辑。”他透露,Infinity计划在2025年底前,支持至少10种不同的芯片架构,包括两种存算一体芯片和一种光计算芯片。

芯片设计自动化的“圣杯”:从RTL到物理设计

如果说生成推理内核是“软件层自动化”,那么生成RTL代码就是“硬件层自动化”的第一步。RTL(寄存器传输级)是芯片设计的核心抽象层,它描述了数字电路的行为,是后续逻辑综合、物理设计的基础。传统上,RTL代码由硬件工程师使用Verilog或VHDL手工编写,一个复杂的SoC(系统级芯片)需要数百名工程师花费数年时间。

Infinity的团队已经开始探索用Ignition生成RTL代码。在内部实验中,他们让Ignition生成一个简单的I2C控制器(一种常见的通信协议)。结果,生成的Verilog代码在仿真中成功实现了I2C的读写操作,但综合后的门级网表面积比手工版本大了30%。“这暴露了AI生成硬件代码的核心问题:它知道如何实现功能,但不知道如何优化面积、功耗和时序。”一位参与实验的硬件工程师说,“在软件领域,代码跑得快就是胜利;在硬件领域,代码必须同时满足面积、功耗、时序、可测试性等多个约束。”

这正是Infinity面临的最大技术挑战。AI生成代码的“幻觉”问题在硬件领域可能造成灾难性后果。一个软件bug可能导致程序崩溃;一个硬件bug可能导致数亿美元的芯片报废。2023年,一家知名芯片公司就因为RTL代码中的时序错误,导致流片失败,损失超过3亿美元。Nixon对此非常清醒:“我们不会在短期内推出RTL生成产品。在硬件领域,99%的通过率是不够的,我们需要99.999%的可靠性。”

为了实现这个目标,Infinity正在开发一个基于形式化验证的代码审计模块。形式化验证使用数学方法证明代码的正确性,而不是依赖测试用例。在软件领域,形式化验证已经用于关键系统(如航空航天、自动驾驶),但成本极高。Infinity的团队正在探索如何将LLM与形式化验证工具(如Coq、Isabelle)结合,让AI Agent不仅能生成代码,还能自动生成形式化证明。一位来自Anthropic的研究员表示:“如果Infinity能实现‘代码生成+形式化验证’的闭环,那将是AI在硬件领域的‘阿波罗计划’。”

技术挑战:幻觉、可解释性与规模化

尽管愿景宏大,Infinity面临的技术挑战不容忽视。首先是AI生成代码的“幻觉”问题。在软件领域,幻觉通常表现为错误的函数调用或边界条件;在硬件领域,幻觉可能导致死锁、数据竞争、甚至物理电路损坏。Infinity的测试显示,Ignition生成的RTL代码中,约有15%存在潜在的死锁风险——这在软件领域可能被容忍,但在硬件领域是不可接受的。

其次是可解释性问题。传统硬件设计流程中,工程师可以逐行审查RTL代码,理解每个模块的行为。但AI生成的代码是一个“黑箱”——工程师无法理解为什么AI选择了某种实现方式。这给调试和优化带来了巨大困难。“我们可能需要开发一种‘硬件可解释性’工具,让AI生成的代码附带一个‘设计决策树’,解释为什么选择这种架构、为什么使用这种状态机。”Nixon说。

最后是规模化问题。芯片设计是一个高度复杂的过程,涉及数千个模块、数百万行代码。Ignition目前只能生成单个模块的代码,无法处理模块间的交互和全局优化。一位来自Google的TPU工程师指出:“生成一个I2C控制器和生成一个完整的AI加速器是两回事。后者需要理解整个系统的数据流、电源管理、时钟分布等,这超出了当前AI Agent的能力范围。”

战略定位:Infinity会成为“AI时代的ARM”吗?

尽管技术挑战重重,Infinity的战略定位正在吸引越来越多的关注。Nixon在多次采访中提到了一个愿景:“我们最终想让芯片设计像写Python一样简单。”这个愿景的核心,是让AI Agent成为芯片设计者的“智能副驾驶”——自动完成繁琐的代码编写和优化工作,让人类工程师专注于架构创新。

从商业角度看,Infinity正在将自己定位为“AI时代的ARM”。ARM的成功在于,它提供了一个通用的处理器架构,让芯片公司可以快速设计出定制化的SoC。Infinity的目标是提供一个“通用的软件自动化层”,让各种新芯片都能快速获得AI推理能力。这个定位的价值在于,它不与任何芯片公司竞争,而是为所有芯片公司赋能。一位投资人评价道:“Infinity不是在做芯片,而是在做‘芯片的软件工厂’。如果成功,它将控制AI芯片生态的‘上游’——就像ARM控制处理器架构一样。”

然而,这个定位也面临风险。ARM的商业模式依赖于IP授权,而Infinity的商业模式是SaaS订阅。这意味着,Infinity需要持续证明其生成的代码性能优于手工优化,否则客户会流失。此外,随着AI Agent技术的普及,大型芯片公司(如Intel、AMD)可能会自研类似的工具,形成竞争。

Nixon对此并不担心:“我们的优势不是AI技术本身,而是我们对硬件和AI交叉领域的深度理解。这种理解需要多年的积累,不是简单地用LLM生成代码就能复制的。”他透露,Infinity正在与多家芯片公司合作,建立“芯片软件基准测试”——一个用于评估AI生成代码性能的标准化测试集。这个测试集将成为行业标准,进一步巩固Infinity的技术壁垒。

数据指标与未来展望

在技术指标上,Infinity展示了一些令人信服的数据。Ignition生成的推理内核代码,在形式化验证中的通过率从2023年的65%提升到了2024年的92%。在未来的12个月内,Nixon计划将这个数字提升到99%以上。同时,Ignition支持的芯片架构数量将从目前的4种(Groq、Cerebras、Tenstorrent、SambaNova)扩展到2025年的10种以上。

但最令人兴奋的,可能是Infinity在“芯片设计自动化”领域的进展。Nixon透露,团队正在开发一个名为“Ignition-HW”的实验性产品,目标是生成完整的AI加速器RTL代码。在内部测试中,Ignition-HW已经成功生成了一个简单的卷积加速器,面积和功耗与手工版本相当,但设计时间从6个月缩短到了2周。“这还只是一个概念验证,”Nixon说,“但它让我们看到了未来的可能性。”

在硅谷的AGI House里,Nixon经常在深夜与研究员们讨论一个更宏大的问题:如果AI Agent可以设计芯片,而芯片又可以运行AI Agent,这是否会形成一个“自我进化的闭环”?“想象一下,一个AI Agent设计了一个新芯片,然后这个芯片运行了更强大的AI Agent,后者又设计出更快的芯片。”Nixon在最近的一次技术分享中说道,“这不再是科幻,而是我们正在构建的现实。”

对于Infinity来说,从代码生成走向芯片设计自动化,是一条充满荆棘但回报巨大的道路。它需要解决幻觉、可解释性、规模化等根本性技术挑战,同时也需要应对Nvidia、Intel等巨头的竞争。但Nixon和他的团队相信,AI Agent的“自我进化”能力,最终将打破半导体行业的“摩尔定律天花板”。正如他在一次内部会议上所说:“我们不是在优化现有规则,而是在创造新规则。”

结语:在CUDA的裂缝中,Infinity能否成为AI芯片的“软件工厂”?

Infinity的故事,本质上是一个关于“打破锁定”的故事。在AI芯片的竞技场上,Nvidia的CUDA生态被视为不可逾越的软件长城,但Infinity的Ignition用AI Agent的方式,在这座长城上凿出了一道裂缝。它证明了,对于推理场景而言,软件生态的构建可以不再是“年”为单位的马拉松,而是“天”为单位的冲刺。创始人Jeremy Nixon的愿景——让芯片设计像写Python一样简单——虽然听起来像科幻,但Ignition在Groq和Cerebras芯片上的实际表现,已经让这个愿景变得触手可及。

然而,裂缝不等于崩塌。Infinity面临的核心挑战,不是技术上的“能否生成代码”,而是商业上的“能否构建生态”。Ignition生成的代码虽然快,但它解决的是“如何让新芯片跑起来”的问题,而不是“如何让开发者愿意为新芯片写代码”的问题。后者的壁垒是网络效应、开发者习惯、社区支持——这些软性因素,不是AI Agent能自动生成的。此外,Nvidia的CUDA Assistant、形式化验证的缺失、以及从推理扩展到训练的难度,都是悬在Infinity头上的达摩克利斯之剑。

从投资角度看,1500万美元的种子轮和1亿美元的估值,反映了市场对“AI for Hardware”赛道的狂热,但也隐含了巨大的预期风险。Infinity需要在12-18个月内证明两件事:第一,Ignition生成的代码在复杂场景(如训练、异构计算)下的可靠性;第二,其商业模式(SaaS订阅)能否吸引足够的芯片客户,形成可持续的营收。如果这两点无法实现,Infinity可能沦为“一个有趣的学术项目”,而非改变行业规则的商业力量。

但反过来,如果Infinity能成功跨越这些障碍,它将不仅是一个软件工具,而是AI芯片生态的“上游控制者”——就像ARM控制处理器架构一样。在AI推理市场即将超越训练市场的转折点上,Infinity的“去CUDA化”路径,可能成为新芯片公司挑战Nvidia的“核武器”。而这一切的关键,在于Ignition能否从“代码生成器”进化为“芯片设计自动化平台”,以及Nixon能否将AGI House的“社区信任”转化为真正的开发者生态。

核心判断:Infinity的Ignition在12-18个月内,关键观察指标是:1) 能否将训练场景的代码生成性能提升至手工优化版本的95%以上;2) 能否获得至少3家非Nvidia芯片公司的付费客户,并实现百万美元级别的ARR;3) 能否推出形式化验证模块,将AI生成代码的可靠性提升至99.9%以上。如果这三项指标达标,Infinity将有望成为“AI芯片软件工厂”的行业标准,并吸引新一轮大规模融资;反之,如果客户拓展缓慢或技术瓶颈无法突破,其1亿美元的估值将面临显著回调风险。