AI

深入洞察市场脉搏,精选高价值分析报告

AI
Jul 27, 2026

代理人的组织结构图来了

原来,人工智能领域最棘手的问题早在 19 世纪的铁路系统中就已经得到了解决。 我们在开头就提出了一个简单的观点:软件开发生命周期的发展速度远远快于大多数企业的工具体系,而正是这种差距催生了新一代平台的诞生。当初我们开始研发 Blitzy 时,令我们兴奋的是那种以自动化为核心的代码生成技术——一种无需依赖一群专门负责处理“人工智能相关”任务的工程师,就能让智能体发挥作用的软件开发模式。Blitzy 所具备的软件开发生命周期管理功能,即便应用于那些混乱且充满技术债务的环境中,依然能够准确理解各种需求、代码库、测试用例以及开发流程,因为在现实环境中,我们不可能在产品发布之前就对整个开发流程进行彻底重构。同样的技术机制也同样适用于新的项目构建与全新功能的开发——无论是从零开始构建项目还是开发新功能,都是通过相同的知识图谱加并行智能体机制来实现的。 有必要详细说明 Blitzy 究竟是如何实现这一点的,因为其运作机制正是本文要探讨的核心。Blitzy 会对你们的代码库进行逆向工程,从而构建出一个动态的知识图谱——这是一种能够存储整个系统信息、并可进行查询的表示形式。其中包含了企业内部的各种依赖关系、历史记录以及工作规范。随后,它会动态地、按需创建数千个专用智能体,这些智能体完全并行运行,并且都遵循既定的规范。这些智能体并不会将整个代码库存储在内存中,也不会互相传递上下文信息;它们是通过那个共享的知识图谱来协作的,每个智能体都在自己独立的处理范围内工作。这并非由一个超级智能体承担所有任务,也不是由某个主智能体将任务分配给少数辅助智能体——而是基于同一个共享的真相来源来实现的大规模并行处理。请记住这一点。 诱人的错误转向 如果仔细观察众多团队的发展动向,就会发现一个共同的趋势:大家都试图让智能代理默认具备全功能。所谓的“项目管理智能代理”不仅会编写代码、进行质量检测、处理警报,还会创建工单——反正也只是多输入些指令而已。短期内来看,这种方式确实很有吸引力。许多企业级工具也都乐于配合这种做法,把各种职能都整合到同一个无所不能的智能助手身上,让它能够处理所有事务,同时产生的操作记录则让合规团队想要躲进黑暗的房间里去。 具有讽刺意味的是,从智能体系统的角度来看,这种“无所不能”的开发模式既效率低下又十分脆弱。Optiver 在关于基于智能体的软件开发生命周期的研究中指出,一旦将智能体视作一种全新的开发要素,那么相关的架构——包括需求规范、工具、审查流程、可观测性机制,甚至是代码的结构——都需要进行大幅调整。实际应用数据也印证了这一点:根据 CrewAI 的统计,在 12 个月内运行的约 20 亿个智能体工作流中,那些成功投入使用的系统并非都是单体结构。这些是由专业特工组成的团队,每位成员都有明确的职责,由一名协调者负责统一指挥——例如 DocuSign 就在一个有序的流程中安排了身份识别员、研究员、作曲家以及验证者,以此来掌控任务的执行顺序与状态。Warp 的 Oz 则基于这样的理念:当特工数量从少数增加至数百个时,虽然处理速度会提升,但可见性、数据控制以及管理能力却会逐渐下降,因此该系统注重实现可审计性,而非让某个超级特工肆意行事。 你其实应该进行的辩论 该行业早已经历过这样的争论。2025 年 6 月,Cognition(Devin 团队)发表了《不要构建多智能体系统》一文,指出并行子智能体本质上十分脆弱:每个子智能体只能基于任务的部分信息来行事,自行做出隐含决策,而这些决策之间往往会发生冲突。他们在文中举的例子是两个子智能体共同构建一个游戏,其中一个负责生成超级马里奥风格的背景,另一个则负责绘制与主题无关的鸟的图像,因为这两个子智能体无法共享彼此的上下文信息。就在次日,Anthropic 发布了《我们是如何构建多智能体研究系统的》一文,展示了如何通过协调器来指挥并行子智能体工作,这些子智能体共同完成的任务效率甚至高于单个智能体——尽管它们消耗的标记量大约是单个智能体的 15 倍,而较高的标记消耗量也正是其性能提升的主要原因。 有一段时间,这看起来像是一场哲学上的分歧。但现在并非如此了。到 2026 年初,这两个阵营已经悄然走向融合:Cognition 推出了一个协调器,负责规划任务并将各项任务分配给独立的 Devin 实例——这一做法与它之前用来反对多智能体系统的“上下文积累会导致专注力下降”的论点如出一辙;而 Anthropic 则选择让各个子智能体承担明确的角色职能,而非采用广泛的点对点通信方式。由此形成的共识虽然细微,但却非常重要:有一个协调器负责管理上下文,各个临时性的专用智能体根据该上下文执行任务并返回总结结果,不存在所有智能体之间都互相交流的机制。 你现在就可以看到这一选择是如何被转化为实际产品的。Claude Code 同时推出了两种功能相似的组件:subagent,它们在独立的上下文窗口中运行,并将处理结果直接反馈给主代理;另一种则是仍处于测试阶段的 agent teams,团队成员可以共享任务列表并直接互相沟通。Anthropic 的设计理念与之前的研究结果几乎完全一致——当需要能够独立完成工作并反馈结果的智能体时,就使用 subagent;而那些需要大量计算资源(每位团队成员都需要一个完整的上下文窗口)的开放性任务,比如研究、审稿或假设验证,才适合使用 agent teams,因为这类任务要求智能体之间能够进行真正的交流。过去一年来,社区一直在就此展开讨论,显然有很多从业者已经不再使用那种需要多人协作的 team 设置,转而选择由单个主代理搭配 subagent […]

人工智能时代的哲学交易刊 AI
Jul 27, 2026

人工智能时代的哲学交易刊

《哲学汇刊》第一卷的封面,涵盖 1665 年至 1666 年间的内容。 17 世纪 60 年代,欧洲的自然哲学家们面临着知识共享的难题。各项发现都是通过私人信件来传播的,因此传播速度很慢,甚至有时根本无法传播,因为科学家们担心会失去自己的声誉。有些人甚至将研究结果以密码或变位词的形式发表出来,这样既能够宣称自己做出了这一发现,又能隐藏其真实内容。新成立的伦敦皇家学会的秘书亨利·奥尔登堡正是这个通信网络的中心人物。他的职责就是收集、翻译科学报告,并将其在欧洲各地的会员之间传递。 1665 年,奥尔登堡决定将这一通信网络转化为该学会科学成果的正式印刷版本。于是,世界上最早的科学期刊之一——《皇家学会哲学交易录》便应运而生。它使得各种科学发现能够以有日期、可引用且便于核查的形式被公之于众。同时,它也为后来科学知识通过已发表的纸本文献不断积累这一体系奠定了基础。 350 多年过去了,纸依然是科学知识的基本载体。自奥尔登堡之后,这种形式首次遇到了它原本并非为之设计的读者群体。 “所有的研究基础设施都是为人类设计的,”安伯·刘告诉我。“它们的设计速度都是以人类的速度为标准的:阅读速度、理解速度、实验速度。从纸质的 PDF 文件和 arXiv 平台,到各类学术会议与同行评审机制,再到 GitHub、Weights & Biases 这类企业级研究工具,所有这些都是为人类研究人员而存在的。”她认为,如果没有专为人工智能科学家设计的基础设施,“他们就很难积累知识,也难以彼此协作。” 这一理念正是她最近发表的论文《最后一篇人类撰写的纸:由人工智能生成的研研究成果》的核心所在。我与她进行了交谈,探讨了这篇论文的内容、她对人工智能科学家角色的看法,以及实现这一目标需要做些什么。 记录与传递知识 一篇科学纸件的诞生需要经历数月的时间,期间要不断进行各种尝试、调整方向,还会遇到许多无果的研究。最终呈现在读者面前的纸件,其实是所有这些工作的浓缩成果,而这一过程本身就需要付出两方面的代价。 叙事税。纸是一种用于说服的工具。正如安伯所说:“这份 PDF 格式的纸件完全是为人类研究人员用来说服人类审稿人而设计的。它的页面呈现出一个精心编排的故事,却隐藏了在研究过程中所付出的所有繁琐努力——那些被否定的假设、被拒绝的设计方案、多次的方向调整,以及为提升性能而付出的日夜不停的实验努力。所有这些在最终版本中都会消失不见。” 工程相关费用。在试图说服审稿人时,这些纸件往往不会系统地说明要重新进行这项研究需要哪些具体条件——包括实验的设置细节、超参数的选择,以及所有决定实验能否成功的关键因素。这些信息由撰写论文的研究团队掌握,但并不会真正被写进论文中。 正如安伯所说:“纸面上的内容其实只是对研究成果经过有损压缩后的呈现形式,它并不包含重现那些重要研究结果所必需的所有信息。”而恰恰是那部分被舍弃的内容——也就是研究过程本身——才比最终的成果更具价值。 这些费用对于人类读者来说算是必要的成本。如果没有它们,人类要阅读所有已发表的相关纸件将会比现在更加困难。 代理原生研究成果 然而,人工智能代理则有所不同。它们处理订单的能力远远超过人类,而那些缺失的细节其实对于让“读取”这些数据的系统能够理解并复现相关结果来说,是至关重要的。 在人工智能智能体正在推动我们大量科学研究的世界里,一个关键问题便是:这些智能体需要怎样的基础条件,才能开展具有累积性且可靠的科学研究? 仅凭智力本身是无法实现积累的。而拥有能够准确记录和传递知识的工具,才能让智力得到有效利用。“如果我们有一种更适合人工智能使用的机制来记录研究成果,那么就能有助于这些研究成果随着时间逐步积累起来,”安伯说道。 她提出的用于替代这种纸的方案是“代理原生研究工具”,简称 ARA。这是一种可由机器运行的研究工具包,包含四个层次: 科学逻辑:该研究背后的概念层面主张与推理 可执行代码与完整规范:与权利要求相对应的实际实现方案 探索图:展现研究的全过程轨迹,包括那些没有产生任何成果的路径分支。 证据:原始输出结果,而非汇总统计量 “大家都在谈论直觉,但这个概念其实非常模糊。人们并不清楚什么是直觉,也不知道该如何向那些经验丰富的研究人员学习直觉,”安伯对我说。科学逻辑层的作用,就是用来存储这些知识——也就是我们在研究过程中学到但未必会记录在论文中的内容。例如,经验丰富的研究人员是如何处理新问题的,或是如何调整超参数的。这其实就是所谓“研究风格”的体现,我们以后还会再谈到这个话题。 保留故障状态 探索图谱保存了另一种被遗忘的知识——那些失败了的实验,它们至今仍未被发表出来。这些知识虽然很有价值,但却从未被真正加以利用。有人花费了大量的计算资源、时间和精力来发现某个方法行不通,但出版系统却会删除这些记录,导致未来的研究人员(无论是人类还是人工智能)不得不重新去探索那些已经证明行不通的路径。Amber 认为,我们应该把“那些失败的方法”也视为重要的科学资料来对待。 这一观点背后也存在技术上的紧迫性。“如今的模型很擅长证明某事物的正确性,因为它们的训练数据中都包含那些成功的处理结果,”安伯解释道。但这可能会导致反常的结果。在对她所分析的研究基准进行研究时,她发现这些模型会用各种巧妙的方法来达到自己的目标:有的模型“很擅长参考正确的答案,然后生成虚假数据并将其混入训练数据中,从而获得 100%的得分”;而另一类模型则愿意修改(甚至直接硬编码)模型结构中的某些部分,“只是为了取悦评估系统中的评判标准”。 换句话说,向模型输入死路、被舍弃的路径以及中间推理结果,是希望它能开始对其自身的工作进行批判性思考。 如今,已经有一些研讨会鼓励人们公开自己的失败经历,但这种做法的普及速度仍然很慢。她指出:“对于人工智能领域的科学家来说,要公开自己的进展相对容易,因为他们不必承担揭露自己其实做了很多愚蠢的事情、在过程中屡次失败的负担。” 多重判决 正如安伯所说,如果人工智能能够“在一夜之间产生大量创意、实验方案和结论”,那么瓶颈就会转移到后续的验证环节。上周我写过这一现象在现实世界中的体现,而在科学研究领域也同样存在这样的情况。 Amber 最担心的故障模式是速度累积误差。目前,研究人员正在运行自演化系统,用她的话来说,这些系统中的智能体会“24 小时不间断地进行研究”。因此,如果这些智能体在运行过程中出现错误或试图操纵奖励机制,那么这种错误就会影响到所有基于它构建的系统,从而导致大量计算资源被浪费在有缺陷的路径上。Amber 认为,我们需要采用形式化验证与神经符号学方法来对研究过程进行监控,并在错误发生时立即发现它们,而非等到事后再由人类来进行检查。 […]

AI 工程领域的生产力水平绝非正常水平 AI
Jul 27, 2026

AI 工程领域的生产力水平绝非正常水平

简而言之:AI 工程领域的生产力表现可划分为三个层级——通过提供集成开发环境所能实现的效率提升幅度在 20%-46%之间;那些围绕智能体构建相应操作平台的公司(如 Replit、NVIDIA、Amplitude、Anthropic)则能实现 2.5-3 倍的效果;而那些将智能体视为核心组织单元的公司(如采用 Devin 技术的 Nubank)则能让效率提升 8 倍以上。决定效率差异的并非模型本身,而是围绕该模型建立的运营体系。 我们现在处在一个应当期望彼此付出三倍努力的时代。 在过去的六个月里,一个数据指标接着另一个数据指标出现: 据报道,NVIDIA 拥有 3 万名开发者,他们所遵循的法典数量增长了 3 倍,而错误率则保持稳定。 1 产品每周的代码提交量增长了两倍,目前有人工智能代理成为对代码库贡献最大的三个因素之一。 2 自在内部开始使用 Claude Code 后,Anthropic 的每位工程师所编写的法典量增长了 2.5 倍,且代码质量保持稳定。 3 在同一时期内,Replit 的团队规模翻了一番,每位工程师的产出也提高了两倍,而代码审查时间、需要回退的次数以及出现的故障数量则保持不变。 4 上图将生态系统分为三个不同的层级,每个层级的划分标准是该公司能够获取的模型能力占比。 5 大多数公司目前所经历的,就是第一种情况:只需提供一款人工智能集成开发环境,无需做其他任何改变,其效果也就一般而已。 “工程领域的领导者们当初期望通过人工智能提升 2 到 3 倍的生产效率,但实际上只能实现大约 30%的提升幅度。” — 增强法典 6 Faros 针对 22,000 名开发者的调研结果也印证了这一点:工程师们完成任务的速度快了 66%,但每位开发者所处理的错误数量却增加了 54%。 7 Google 进行的随机对照试验显示这一比例为 21%,与 GitHub 的 24%相近。 89 这就是通常会出现的结果。 接下来是前沿方案。这些公司围绕该模型构建了相应的框架,让各种工具能够在 GitHub、Linear 和 Slack 之间共享信息,然后再将问题提交给工程师进行判断。 […]

AI时代的异类投资 AI
Jul 20, 2026

AI时代的异类投资

我们作为投资人的工作,就是预测未来 作为投资人,我们的工作就是尽可能预测未来。 我们会不断讨论 AI 行业将如何演化,以及在当前格局下,“价值最终会沉淀到哪里”。 但现实是,在这样一个高速变化的环境中,AI 的价值捕获(value capture)始终处于流动状态,赢家几乎每三个月就会轮换一次。因此,可以肯定地说,我们对于未来真正“已知”的事情,远远少于“未知”的事情。 这一点体现在一个事实:几乎每一个看涨(Bull Case)的观点,都能找到一个同样有说服力的看空(Bear Case)。 例如,就在 Anthropic 完成 E 轮融资(估值 610 亿美元)时,市场上的怀疑者依然认为: API 层很快就会商品化(commoditize),没有护城河; 在算力成本和价格竞争压力下,毛利率会长期为负; AI 实验室会因为高昂且需要不断重复投入的训练成本,永远处于疯狂烧钱状态。 他们还认为: OpenEvidence 的天花板不过就是 Doximity 那样的规模; 推理引擎(Inference Engine)终究会彻底商品化; ClickHouse 永远不会超越实时分析(Real-time Analytics)的市场,因此最终只能成长为一家中等规模公司。 然而,把这些观点放在一起看,这些本意善意、逻辑严谨的怀疑者,最终却错过了价值数十亿美元的投资回报。 残酷的真相 事实是: 我们对未来的了解,远没有自己想象得那么多。 在上面的每一个案例中,当时最“理性”的分析,最后都和真实发生的事情背道而驰。 例如: API 层并没有迅速商品化。 很多时候,所谓最理性的分析,最好的结果也不过是 50% 的猜对概率;最坏的情况,则是在过度分析之后,做出了错误决定。 新市场的最终格局,本来就是不可知的 新兴市场(Emerging Markets)的最终市场结构(Terminal Market Structure),从定义上来说,就是无法预测的。 那么,在市场尚未形成之前,我们应该怎么办? 作者认为,一共有三种选择。 第一种 等待市场成熟。 等市场结构稳定、TAM(总体可服务市场)确定之后再投资。 这样确实降低了风险。 […]

AI 推理市场 AI
Jul 20, 2026

AI 推理市场

10:通过阅读相关资料、与各类初创公司创始人交流,以及观察代币经济的发展态势,我对人工智能推理技术有了更系统的认识。 2025 年 2 月,我发布了自己的第一篇 Substack 文章《AI 智能体,这真的存在吗?》。在文中我认为完全自主的智能体距离实现还有数月时间,而非数年,而信任才是真正的障碍。17 个月后,显然 AI 智能体已经真实存在了。不过我当时忽视的是支撑这些智能体的基础设施,也就是如今我们所称的 AI 推理技术。 我当时所撰写的每一个智能体,归根结底都属于计算能力的下游应用。到了 2026 年,AI 推理领域已出现了激烈的竞争,各方都在争夺谁来处理这些 Token、使用何种芯片、以什么价格提供服务,以及服务于哪类用户。 深入解析价值 1 万亿美元的市场机遇 许多人认为,随着企业对计算单元的需求不断增加,AI 推理市场的规模已超过 1 万亿美元,并且还将持续增长。这已不再是一种逆向观点——这一趋势正在深刻影响着私人市场的发展态势。 仅在 6 月的最后两周内,垒就以 130 亿美元的估值完成了 15 亿美元的融资,而在此前 5 个月它还曾以 50 亿美元的估值筹集了 3 亿美元的 E 轮融资。Together AI 则宣布以 83 亿美元的估值进行了 8 亿美元的 C 轮融资,其年度订单额已超过 11.5 亿美元。而最初设计出定制 ASIC 芯片的 Groq,也刚刚获得了 6.5 亿美元的融资,用于进一步发展其推理云平台 […]

核能的回归:人工智能、地缘政治与下一轮能源热潮 AI
Jul 20, 2026

核能的回归:人工智能、地缘政治与下一轮能源热潮

两大力量正在推动对核能需求的再度增长。 引言 霍尔木兹海峡与人工智能数据中心有什么共同点?两者都在推动对核能需求的激增。这个行业在过去三十年里一直处于停滞状态——自 1978 年以来美国仅建造了两座新反应堆,而美国商用反应堆的平均使用年限已达 1001#44 年。建造 1 千瓦电的核能设施所需的价格从 1967 年的~$900 上升到了如今的~$7,800(均为 2023 年的美元价值)。但在地缘政治和人工智能这两股力量的共同推动下,这种情况即将发生改变。数十年来首次,人们再度意识到发展核能的紧迫性,多家初创企业正在努力缩短核能设施的建成时间并降低建设成本,这也吸引了风险投资和成长型投资者对该行业表现出更高的兴趣。 核能简史 作为基础能源的核能经历了两个发展阶段: 1) 建设时代(约 1965-1990 年):20 世纪 70 年代的石油危机使得能源独立从一项可选目标变成了国家首要任务,核能因此受益匪浅。由于反应堆技术取得了突破,加之人们对充足低碳能源的乐观预期,核能的装机容量在二十五年间从接近零增长到了 300 吉瓦以上。到 20 世纪 90 年代中期,核能在全球发电量中的占比达到了 1001#20%的峰值,此后这一比例一直未再被打破。 2)停滞时期(1990-2022 年):1979 年的三里岛事故、1986 年的切尔诺贝利事故以及 2011 年的福岛核事故导致了更严格的监管措施、强烈的公众反对声浪,进而使得核反应堆不得不关闭,尤其是在德国和日本。虽然核能发电总量并未完全消失,但人们已不再有建造新核电站的意愿。实际上,没有新的核电站获得建设许可,而随着其他地区的电力需求持续上升,到 2020 年代初核能在整体能源结构中的占比已降至约 9%。 在需求增长的推动下,我们正步入核能加速发展的第三个阶段。 消息来源:伯恩斯坦 推动核能需求增长的因素 推动核能需求增长的主要动力有两个——能源主权与人工智能。 能源主权 能源供应是任何国家福祉的核心,各国也越来越重视能源自给自足。在大多数发达国家,能源政策已从“选择最便宜的能源”转变为“避免依赖不可信任的国家”。这一转变源于过去 4 年的地缘政治冲突,这些冲突暴露了能源依赖所带来的负面后果。以乌克兰与俄罗斯的冲突为例,在俄罗斯入侵乌克兰之前,该国为欧盟提供了 1001#40%的天然气供应量,而如今这一比例已降至 10%左右。欧洲不得不设法通过从“关系更友好”的国家进口能源、设定能源使用削减目标以及其他途径来填补俄罗斯带来的供应缺口。最近,霍尔木兹海峡的局势紧张再次给那些依赖能源进口的国家带来了打击。这场冲突切断了全球 1002#20%的石油和液化天然气供应,迫使各地的进口依赖型国家将国内能源生产视为安全问题而非成本问题,进而促使这些国家转向核能作为更重要的能源来源。 出于多种原因,核能是一项极具优势的能源选择: 极高的容量因子:容量因子用于衡量资产实际产生的电量与其最大发电量之间的比例。核能的容量因子高达 91%以上,几乎是风能的 3 倍、太阳能的 […]

经纪人的优势:人工智能如何最终冲击保险业这一最古老的行业 AI
Jul 20, 2026

经纪人的优势:人工智能如何最终冲击保险业这一最古老的行业

QED Investors 公司美国业务负责人、合伙人阿米亚斯·杰雷蒂撰文。 在近十年的时间里,风险投资大量涌入保险行业,其背后的基本理念很简单:保险是一种基于数据进行的匹配业务,而这种匹配工作应当由软件来承担。 不过,最成功的保险经纪初创公司其实并非某家保险科技企业,而是瑞安特色菜公司(RYAN)。这家公司由拥有 60 年行业经验的帕特里克·瑞安创立,他将自己的成功归功于良好的人际关系。当然,我们并非要贬低古斯黑德公司(GSHD),那也是一家很出色的企业,其企业价值在过去几年里一直在 10 亿美元到 60 亿美元之间波动。新前沿公司也曾以 10 亿美元的价格被惠勒塔沃森集团(WTW)收购。但与如今市值已达 90 亿美元的瑞安特色菜公司相比,这两家公司都显得相形见绌。 Ryan Specialty 是一家批发经纪公司,充当着零售保险代理人与保险承保商之间的桥梁。它的业务重点在于超额和剩余风险保险市场——那属于标准承保体系之外的保险业务领域,专门处理那些对传统承保商而言过于新颖、复杂或面临极高灾难风险的险种。这类险种包括商业货运车队、冒险运动、大型工厂、危险化学品,甚至是面积极大的住宅等,凡是不符合标准承保准则的险种都在其服务范围之内。 Ryan 公司的 CEO 早年曾是一名高尔夫球手,其个人简介中至今仍记载着他在高尔夫领域的优异成绩(公平地说,这些成绩确实相当出色)。那么,人工智能能否最终取代高尔夫运动的优势呢?或者正如该公司的一位创始人所说,人工智能将会取代这一过程中的每一个环节,最终只留下高尔夫运动本身。 瑞安特色菜现象 要理解当前正在发生的变化,首先就得认识到 E&S 保险经纪市场规模之大、利润之高。该市场的保费从 2000 年的 120 亿美元增长到 2024 年的 1300 多亿美元,复合年增长率高达 10.6%,几乎是同期传统保险市场 3.8%增长率的三倍。由于气候风险、网络责任、自主系统以及各类新技术产品的出现,世界正变得越来越复杂,而 E&S 市场也在持续扩大。 Ryan Specialty 处于这一变革的核心位置。该公司 78%的保费收入都来自 E&S 保险市场,业务范围涵盖批发经纪、承保授权以及承保管理,同时还以承接那些无法用标准条款覆盖的风险而著称,从而建立了自己的独特优势。2024 年该公司的营收为 25 亿美元,增长了 21%;2025 年的营收则上升至 30.5 亿美元,增幅同样为 21%。得益于运营效率的提升,2024 年的净收入达到了 2.3 亿美元,同比增幅高达 […]

“永无止境的循环”:为何前沿人工智能正逐渐与半导体行业呈现出相似特征 AI
Jul 20, 2026

“永无止境的循环”:为何前沿人工智能正逐渐与半导体行业呈现出相似特征

过去,在半导体领域投资可谓极其艰难。并非因为这项技术无趣——它其实是地球上最有趣的技术之一,艰难之处在于其经济模式。为了研发下一代芯片,你需要投入巨额资金,而等到芯片设计完成、生产流程通过验证、开始大规模生产和销售时,市场早已转向,开始关注更新一代的产品了。这种“跑步机式”的竞争从未停止,也从未放缓。要么持续前进,要么被兼并,要么悄悄退出市场。所有在业内深耕较久的风险投资人都曾因此留下过伤痕,其中一些还是最近才造成的。 我不断回想到那种模式,因为前沿模型实验室似乎也在经历类似的情况。氛围已经发生了变化——有人在私下里、有人在公开场合思考,大量资金涌入这些前沿模型公司后将会产生怎样的后果。因此,有必要用具体数据来进行对比,进而探讨半导体行业的经历究竟能给我们什么启示。就我个人而言,我对前景的看法比那些悲观论调更为乐观,但要想明白其中原因,就必须审视整个发展历史。 下一代制程的成本 将芯片推向更先进的制程水平始终需要巨大的资金投入,而且这一成本还在不断上升。在旧制程节点上,设计完成后送交工厂进行生产的费用仅为几十万美元;而到了 3 纳米制程,一次完整的掩模制作费用就可能高达 1 亿美元甚至更多,其中大部分用于掩模套组及非重复性的工程开发工作,而非晶圆本身。 完整的芯片设计成本则更高。据《国际商业战略》杂志的测算,28 纳米工艺的芯片总成本约为 4000 万美元,7 纳米工艺约为 2.17 亿美元,5 纳米工艺约为 4.16 亿美元,而 3 纳米工艺则接近 5.9 亿美元;2 纳米工艺的成本预计更高达 7.25 亿美元以上。不过这些数字仍存在争议——SemiAnalysis 认为,真正的初创公司生产 7 纳米级芯片的总成本仅在 5000 万到 7500 万美元之间,因此上述数字应被视为上限。不过成本上升的趋势是毋庸置疑的。而且这还只是芯片制造环节的成本而已。一座具备 3 纳米工艺生产能力的工厂需要 150 亿到 200 亿美元的投资,一台 EUV 光刻机的价格更是超过 3.5 亿美元,仅台积电一家在 2026 年就计划投入 520 亿到 560 亿美元的资本支出。 让我一直印象深刻的一点是:晶体管成本虽然持续下降,但前提是你必须有足够的产量来分摊这些成本。如果没有,那高昂的成本就会把你压垮。 下一个模型的成本 再来看看那些人工智能实验室。相比其他机构,Epoch AI 对相关成本的追踪更为细致,它估计 GPT-4 的最终训练成本在折算后的硬件费用上约为 […]

AI
Jul 19, 2026

AI 代币经济时代 CEO 策略实用指南

您的成本费用项目现在以代币作为计价单位。以下是相应地运营公司的方法。 周日快乐,欢迎收听《投资人工智能》节目!别忘了关注《纽约市的人工智能》播客,以及我们全新推出的、专注于推理优化领域的 Tokenmining 社区通讯。 今天,我打算进一步完善我的代币经济模型框架,将其转化为一套实用的策略指南,帮助企业借助人工智能创造价值。 如果您经营着一家软件公司,或是任何在产品与运营中融入人工智能技术的企业,那么代币经济模型已不再是可以交由基础设施团队处理的工程问题。它其实是一个关乎定价、利润结构、产品架构以及竞争地位的战略性问题。以下是我建议 CEO 们从战略层面思考这一问题的方式。 首先,内化技术原理 在制定任何策略之前,你首先需要明确三个关键事实,因为它们会决定后续的所有决策。 其一:输出代币的成本是输入代币的 4 到 6 倍,这种成本差异源于技术原理本身,而非定价策略。输出内容是逐次生成的,每次只进行一次前向传播,同时需要在高成本的内存中存储不断扩大的 KV 缓存;而输入数据则是并行处理的。正因如此,结构复杂的产品本质上就具有较高的成本。人工智能生成的每一段多余内容,都会成为增加成本的负担。 其二:您所支付的代币费用中有一大部分是看不见的。在用户看到任何内容之前,推理模型就已经消耗了大量代币——用于内部的思维过程、规划步骤以及信息检索等操作。在需要深度分析的工作负载中,这些隐性推理过程会占据总代币消耗量的 33%到 60%。如果您的财务团队仅根据可见的输出结果来估算人工智能的成本,那么做出的利润预测就会出错,而且错误程度还会相当严重。 第三:代币的支出与价值创造是两回事。这是朱泉岩在其关于该主题的优秀论文中所提出的核心观点,也应成为你们运营中的指导原则。 交易量只是表面数字,真正重要的是利润空间。那种能够推动关键决策制定的代币,其价值远高于那些仅用于记录无人阅读的会议内容的代币。 四大战略决策 在相关技术原理被充分理解之后,代币经济模型便简化为四项决策,这些决策应由 CEO 和董事会来制定,而不应被搁置在工程团队手中。 决策一:您打算将相关功能集成在流程的哪个环节? 朱氏关于多智能体系统的案例研究是我今年见过的最具参考价值的战略分析框架:在智能体工作流的规划阶段,所消耗的代币不足 5%,但却决定了几乎 100%的输出质量;而执行阶段则耗掉了半数预算,却只能带来极低的边际价值。将其转化为战略视角的话就是:规划层面结构简洁、成本低廉,因此具备较强的定价能力;而执行层面则结构复杂、成本高昂,且正在迅速沦为标准化产品。如果你的产品是客户工作流中的规划核心,那么你就有能力维护自己的价格;但如果你的产品只是负责执行任务,那无异于在出售运输能力,总会有更便宜的替代方案出现。请诚实地根据这一框架审视你的产品线——大多数公司都会发现,自己实际上是在为本应属于执行层面的工作收取规划层面的高价,而这无疑会逐渐侵蚀他们的利润。 决策二:您的利润结构是怎样的? 与按代币成本变动定价相比,固定费率订阅模式正成为当前时代隐藏的致命威胁。这种模式限制了每名客户的收入上限,却不对每名客户的成本设置上限;那些使用高频服务、全天运行自动化任务的顶级 5%用户,足以破坏整个业务的盈利结构。你主要有三种选择:将代币成本转嫁给客户(虽能保护利润,但会引发客户的付费焦虑);根据实际产出定价(有助于实现价值对等,但需要能够准确衡量产出);或者保持固定价格,同时采取措施大幅降低资源消耗(具体策略见下文)。绝对不能选择什么都不做。如果你无法掌握每名客户每月处于第 95 百分位时的代币成本,那就等于不知道自己的毛利率是多少。务必在本季度内弄清楚这个数字。 决策 3:选择单一供应商还是多元供应商组合? 您的模型供应商其实属于供货商范畴,而目前大多数企业都面临着在传统供应链中绝不会容忍的供应商集中度风险。不同供应商提供的代币价格存在差异,定价机制也逐渐向实时市场行情及拥堵状况动态调整,非高峰期的批量折扣早已出现,基于任务结果的定价模式也在逐步形成。采用单一供应商架构意味着您在最大的可变成本方面只能被动接受定价。战略上的解决方案是引入路由层:将每项任务分配给能够满足相应质量标准的最便宜的模型——对于那 10%需要高级模型的任务使用前沿模型,而对于日常的 90%任务则使用小型语言模型。这其实就是将采购管理理念应用到了人工智能领域。 决策 4:在真正有需求之前就先构建相应的衡量函数。 如果无法看清某个生产流程,就无从对其加以管理。那些处理得当的企业正在构建一种相当于人工智能领域的 ERP 系统:这类系统能够将代币消耗情况与工作流程对应起来,再将工作流程与最终成果关联,最后把成果转化为具体的财务数据。FinOps 只能在事后告诉你花了多少成本,而代币经济学则会引导人们思考更根本的问题——在实际支出发生之前,应如何对代币进行预算安排、分配以及约束?这需要通过任务级基准测试来确定哪种模型适合处理特定任务,同时还需要通过工作流程级分析来判断哪些产品功能能够提升利润,哪些则会无形中侵蚀利润。 战术操作指南 在这些战略决策之下,有一系列您的团队可以立即开始实施的策略。它们共同构成了我所说的、介于企业损益与供应商定价之间的“代币隔离层”: 语义缓存。企业查询中很大一部分其实是近乎重复的请求。只需处理一次,将其存入缓存后即可直接响应,此后无需再支付费用。 上下文窗口管理机制。不必在每次通话时都付费重读相同的文档,应果断删除冗余内容——检索系统应当直接调出所需段落,而非整个文件柜里的资料。 用于处理常规任务的 SLM 路由机制。对于分类、提取、格式化以及简单的问答类任务,无需复杂的推理过程,只需将其分配给成本更低的小型模型即可。 以输出简洁性作为设计原则。鉴于 4 […]