AI

深入洞察市场脉搏,精选高价值分析报告

异常队列:决策追踪基础设施与垂直人工智能领域的终极目标 AI
Jun 30, 2026

异常队列:决策追踪基础设施与垂直人工智能领域的终极目标

在垂直领域人工智能系统中,最有价值的数据每天都在悄无声息地被产生。有人撤销了被拒的诊疗授权,解决了货运纠纷,或更改了设备订购订单,但一旦他们转向下一个案件,这些决策背后的理由就会立刻消失不见。由于大多数工作都是如此完成的,其背后的判断依据也会永远丢失。 我们认为,在垂直领域人工智能中,决策过程才是真正的关键所在,它决定了哪些产品能够脱颖而出,成为优秀的公司。现有的智能系统已经能够遵循规则、获取所需数据并生成有用的文档,但它们无法处理那些异常情况——也就是那些不符合既定模板、需要根据市场、客户及合作方的具体情况由人类来介入处理的案例。这类任务不会被记录在 ERP、CRM 或 WMS 等系统中,而是堆积在异常处理队列中,一旦有人处理完毕就会立刻消失。从长远来看,谁能够掌握人类在这些决策背后的推理逻辑,谁就能在垂直领域人工智能中获得更高的企业价值。 在早期崛起的垂直领域 AI 企业中,我们已经可以看到这种模式。Tennr 掌控着患者转诊信息,EvenUp 掌握着需求数据包,Abridge 则负责管理临床文档。表面上,这些产品各不相同,但实际上它们都在做类似的事情:它们存在于那些反复出现、且后果严重的工作流程之中,每次问题得到解决后都会留下可重复使用的决策痕迹。这就是异常处理队列,我们认为这是每家垂直领域 AI 企业最值得收集的宝贵资产。 为何挖起杆能发挥作用 在评估那些需要使用挖起杆来处理的异常情况时,我们通常会从两个维度来进行考量:其一为异常出现的频率;其二则为故障(或延误)所带来的成本。前者显然指的是那些需要加以处理的流程异常出现的次数,而后者则是指当这些异常未能被及时发现或妥善处理时将会产生的后果。 那些异常情况频发但后果较轻的工作流或许能够提升使用率,甚至带来短期的收入增长,但使用率并不能体现问题的紧迫性或解决的持久性。这类工作流仅属于生产力工具,而在智能技术日益商品化的背景下,生产力工具其实相当脆弱。至于那些后果严重但发生频率较低的工作流,虽然也较为重要,但其运作方式更接近于咨询项目,而非软件。 当失败或延迟所带来的成本极高时,采购方就会显得极为急切。这种“成本”可能表现为未实现的收入、闲置的劳动力、利润流失、合规风险,或是现金流受阻。正因如此,延迟与失败同样重要。即便技术上通过了预先授权,但如果送达时间过晚,依然会破坏整个工作流程;即使可以申诉却被错过时限,依然会导致收入损失;而那些在发票过期后才解决的货运纠纷,同样会损害企业的现金周转能力。 当失败或延迟所带来的成本极高时,采购方就会显得极为急切。这种“成本”可能表现为未实现的收入、闲置的劳动力、利润流失、合规风险,或是现金流受阻。正因如此,延迟与失败同样重要。即便技术上通过了预先授权,但如果送达时间过晚,依然会破坏整个工作流程;即使可以申诉却被错过时限,依然会导致收入损失;而那些在发票过期后才解决的货运纠纷,同样会损害企业的现金周转能力。 这项测试实际上指向的是异常处理队列——那是一连串由人工进行分类、上报、记录、处理和审核的非标准案例。以预先授权为例,根据 KFF 的最新研究,仅在 Medicare Advantage 计划中,2024 年就提交了近 5300 万份预先授权申请,其中 410 万份被拒绝。只有 11.5%的被拒申请有人选择上诉,而这些上诉中有 80.7%获得了成功。背后的制约因素是什么?就是内科医生的工作负荷。美国医学协会的最新调查显示,内科医生平均每周要处理 39 份预先授权申请,这大约需要 13 个小时的时间。这样的系统实际上是在不断消耗医疗提供者的资源与精力。在那些有人努力争取的被拒申请中,有五分之四最终都被撤销了。 物流领域也存在类似的状况。虽然货物在预约失败或附加费用存在争议的情况下仍有可能送达,但这种延迟依然会造成经济损失。以第三方物流公司为例,多达 35%的发票都会出现争议。错误、漏收费用以及不正确的计费方式不仅会损害盈利能力并提高平均应收账款周转天数,还会导致客户流失。 另一个有用的指标是“衔接功能”。在医疗保健和物流等领域中,护理协调、理赔处理、货物审核、许可证办理以及采购异常处理等工作往往分散在各种电子表格、邮件往来、电话沟通、门户网站以及不同人员的记忆中。相关情境分散在多个系统和不同人员之间,因此问题的解决依赖于人的判断力。 这正是出色的挖起杆该有的模样:那些需要人工决策来处理的任务本就该由专人负责,处理不当会带来高昂成本或延误,同时还会导致任务队列不断积压。 最优秀者进入处理队列之处 最优秀的垂直 AI 企业表面上并不都看起来像专门处理“异常队列”问题的公司。有些企业从异常队列本身入手,处理那些转诊请求、拒付申请、许可审批以及账单纠纷等问题;另一些则从更上游的环节开始,即那些会生成异常队列的初始事件。但决定其长期价值的关键始终是同一个问题:该产品所处的场景中,决策痕迹是否能够自然地作为使用过程的副产品产生? 我们认为存在两个可行的切入点。 在异常处理环节本身。 Tennr 专注于那些已经出现处理故障的案例。EvenUp 则针对那些存在争议的索赔案件展开工作。异常情况频发,失败或延误会带来巨大损失,而且解决问题还需要了解相关背景信息。每一个得到解决的案例都会留下决策轨迹,这是客户所信赖、会转发、审查、审计并据以采取行动的依据,同时也是产品能够学习的依据。当解决问题本身就构成该产品功能时,每个案例解决后就会自然产生相应的决策轨迹。 在上游的创建环节。 Abridge 就是一个很好的例子。从运营角度而言,临床诊疗过程并不总属于“异常”情况,但它始终是那些需要被记录下来的高语境场景。当这些临床细节被用于医疗编码、风险调整以及收入保障等环节时,就会在后续产生异常处理队列。决策轨迹最初来源于这些记录,而随着记录在工作流程中不断流转,这一轨迹也会愈发清晰。一旦掌握了相关背景信息,就能发现后续出现的各种异常情况。 这两种路径都是可行的,因为最终都会达到同一个目标:身处高重要性的工作流中,并在每次问题解决时生成决策痕迹。不同之处在于切入点。从任务队列开始的风险在于,你会处于工作流中最混乱、集成最复杂的环节;而从上游开始的风险则是,即便产生了相关上下文,也未必能传递到任务队列中,从而导致问题累积。Abridge 能够成功运作,是因为临床文档必然会流入编码和计费流程中。而那种只能生成有用文档却无法衔接后续工作流的工具,终究只属于提升效率的工具而已。 像 […]

人工智能是泡沫,还是下一个技术周期?两者皆是,只不过表现形式出人意料 AI
Jun 30, 2026

人工智能是泡沫,还是下一个技术周期?两者皆是,只不过表现形式出人意料

演示 附言:建议您结合演讲者备注来观看,可以通过点击演示文稿左下角的三个点,或者参考下方的备注。 按章节划分的演示笔记 第 1 节:到底发生了什么?? 这是我们今天面临的显而易见的问题。这是我经历过的最奇怪的环境。 简而言之:首先,有一些历史上最成功的公司突然面临资金短缺的问题;其次,有些估值高达数千亿美元的私营企业,但其获得的风险投资却处于十年来的最低水平;第三,地缘政治局势极为动荡,冲突不断。 第 3 页:要回答那个问题,请看看技术发展的历史规律。 希勒市盈率 → 经过 10 年平均通胀率调整后的价格与收益比率 → 在 60 年的时间跨度内显示出相同的走势(1900 年至 1970 年代与 1970 年代至 2020 年代)。 该走势表现为急剧且持续的下跌 → 随后是剧烈的波动与混乱 → 接着是持续的增长,同时在高位出现更多波动,之后这一循环又会重复。 当前的环境与 20 世纪 70 年代(汽车、收音机及大规模生产时代的终结)以及 1910 年代末期(电力与重工业时代的终结)的历史模式相似。 为什么这些图案看起来如此相似? 第 4 页:卡洛塔·佩雷斯基于 200 年的技术发展史,创建了一个模型来解释这一现象。 根据她的模型,一个技术周期的前 20 到 30 年被称为“建设期”,这一阶段是该技术所需的基础设施被建立起来的时期。接下来的 20 到 30 年则属于“应用期”,在这一阶段,该技术会被广泛采用,并为经济带来益处。其发展流程如下: 突破阶段(安装过程的第二个阶段):爱好者们会尝试使用新的“输入要素”(新的组件或能源),以及相应的辅助技术,从而创造出全新的产品类别,进而形成全新的产业。例如,在 […]

是构建专属的垂直领域 AI 智能体,还是为 Claude 和 Copilot 这类现有的通用型智能体提供 MCP 驱动功能? AI
Jun 30, 2026

是构建专属的垂直领域 AI 智能体,还是为 Claude 和 Copilot 这类现有的通用型智能体提供 MCP 驱动功能?

谈谈 MCP、无头产品以及企业的真正价值所在 嗨,朋友们, 我在与各位创始人交流时总会遇到类似这样的问题:是应该构建专属的垂直领域 AI 智能体,还是为客户已经在使用的现有横向智能体提供支持? 对于越来越多的人来说,他们处理知识工作的默认工具现已变为各类横向智能体:Claude Code/Cowork、Codex、Copilot。一天由此开始,许多任务也在这些工具上完成。 因此,如果你正在构建一款产品,就会面临一个选择:要么努力成为某类用户的专属智能体,成为他们而非那些通用型智能体会首先打开的工具;要么接受它们存在于通用型智能体之中的事实,通过为自己的优势领域提供支持来在该智能体中发挥作用。 在这篇文章中,我将探讨: “构建代理”与“赋能代理”的真正含义 如何确定应选择哪条路径 实际而言,同时采用这两种方式需要做些什么 构建该智能体 构建专用垂直 AI 智能体意味着,对于特定的用户群体而言,你希望成为他们的核心智能体——而非作为 Claude 或 ChatGPT 中的连接组件,而是他们打开时首先使用的核心界面。 其优势显而易见:你可以掌控接口,掌握使用数据,还能成为用户处理各项任务时的首选工具。 问题在于,这会提高用户采用你产品的难度,同时还会让你与 ChatGPT、Claude Cowork、Codex 等竞争产品直接对抗。 在两种情况下采用这种策略是合理的。第一种情况是当你本身就已经是核心系统(且/或已经具备相应的操作/交互功能),用户整天都在使用你的产品,此时在产品内部内置智能代理显然比将他们引导到其他平台更有效。第二种情况则是当产品的核心在于特定领域的推理能力,相关任务的专业性过高,以至于通用型智能代理无法妥善处理。本质上,这两种情况都意味着你的产品具有足够的垂直化特征,能够让部分用户将其作为日常使用的核心智能代理。 Harvey 就是一个例子。它认为,对于律师群体而言,该工具应成为核心智能体,而非某个通用型智能体中的功能模块。其他专注于某一特定职业领域的厂商也遵循同样的逻辑,他们认为相关工作的特殊性足以支撑开发专属智能体。 不过,随着通用工具的不断改进,这些垂直领域的某些竞争对手有可能采取“为智能体提供动力”的策略,即在现有的其他横向智能体平台上满足客户的需求。 如果一个通用智能体已经能完成某人工作的大部分内容,要想说服他们转而使用你的产品来处理其中的一部分工作,实在是一件很困难的事。 为智能体提供动力 另一条路径则是接受客户正在使用现有的横向智能体这一事实,通过提升该智能体在自身领域的性能来加以利用,而非试图取代它。 常见的形式是 MCP 服务器,但简洁的命令行界面,或是专为智能体设计的优质 API,也同样可行。 你实际上是在打造一款专为智能体使用而设计的产品版本,这类智能体通常是指横向智能体。 那么在这种情况下,您的产品能带来什么价值呢? 数据与上下文。有些产品的价值源于其承载的数据和动作,而非任何界面,因此目前的趋势是将这些数据暴露在客户已使用的各类平台中。Granola 就是一个很好的例子,它推出了 MCP 功能,让其他智能体能够获取其对应的上下文信息。 功能与动作。另一个可发挥价值的途径,是通过让横向智能体能够接入你的产品,从而扩展或提升其所能执行的功能与动作范围。一个例子就是图像与视频生成平台 Higgsfield,它提供了 MCP 服务器,这样横向智能体就可以运用自身的推理能力与任务协调功能,同时借助 Higgsfield 在图像及视频渲染生成方面的专业优势。 在实践中,大多数采用这种策略的公司都希望找到方法,在数据/上下文以及功能/动作这两个维度上同时创造价值。 有趣的是,现有的行业巨头也在朝这个方向发展。Salesforce 在 2026 年 4 […]

智能体不是产品 AI
Jun 30, 2026

智能体不是产品

到目前为止,大多数公司和个人使用的,仍只是 AI 模型能力中相对基础的一层。这意味着,我们并不会从每一次新模型发布中看到巨大的收益。尽管如此,AI 在许多企业部署中依然屡屡失灵。为什么? 我认为,这是因为大多数企业关于 AI 的讨论都聚焦于错误的问题:我们能把预算中的哪一部分投向 AI?例如,我们是应该继续使用现有软件,如 NetSuite,还是直接用 AI 替代,并迁移到新的 AI 原生 ERP? 而正确的问题其实更为根本,甚至与 AI 本身无关:我们现有的流程是什么?它们又是在哪些环节出现了问题? “如果不从底层重建运营体系,你就无法完成公司的转型,”Varick Agents 创始人 Vas Moza 告诉我。Varick 是一家应用型 AI 公司,进入大型企业组织内部,帮助它们借助 AI 由内而外实现转型。 从底层重建运营,意味着要清楚哪些环节应以确定性方式实现自动化,哪些应交给代理,哪些又应保留给人工处理。这不是模型工程或代理工程的问题,而是流程工程的问题。Vas 说:“正是这种流程再造,能让 AI 的效果提升 100 倍。” 并非每个工作流都需要代理 在企业部署中,首先要回答的问题是,哪些环节不应该代理化——因为并非每个工作流都值得配备代理。对此,我的思维模型是: 确定性自动化适用于规则。 如果输入是结构化的,而且期望的行为可以被明确规定,那么你大概率并不需要一个代理。你需要的是软件。这类工具适用于诸如路由发票、同步 CRM 字段、检查所需文件是否齐全等任务。这些工作流很有价值,但并不需要开放式推理。 代理适用于在具体语境下作出判断。 当工作需要解读输入、跨系统调取上下文,或执行一项会随着代理发现的信息而改变路径的多步骤流程时,代理才有意义。在确定性自动化失效的地方,代理才真正发挥作用。 人类负责问责、处理模糊性,并建立信任。 有些工作应该继续由人来完成。这可能是因为其后果或相关关系过于重要,或者组织尚未明确“做好”究竟意味着什么。在这些情况下,合适的 AI 产品可能是副驾驶、审核者、研究助手,或质量保证层。 接着,即便你已经确定代理是合适的选择,你仍然需要判断它是否值得构建。这是另一项独立评估,考量维度包括可替代的人工工时、关键人员风险、周期时间缩短、收入提升、构建所需的时间与成本,以及最重要的预期投资回报率。Vas 表示:“投资回报率达到 10 倍的工作流应该优先考虑。投资回报率只有 2 倍的工作流,也许值得,也许不值得。而投资回报率低于 1 倍的工作流则应该不要碰。” 代理应当部署在哪里,这一决定是在完成所有这些诊断之后才作出的。至关重要的是,最痛苦的工作流不一定是最值得实现自动化的工作流。 部署才是产品 在许多公司里,工作流程存在于人的头脑中,而他们有时其实并不能清楚地说出自己到底在做什么。这就是“部落知识”问题。 在成为投资人之前,我曾在制造业和供应链领域创办过一家公司。我记得当时试图通过询问员工做些什么来理解工厂的工作流程。他们总是能演示给我看,但很少能把它解释清楚。 […]

二元结果陷阱:论“造王者”、过早庆祝,以及那些悄然消失的结果 AI
Jun 30, 2026

二元结果陷阱:论“造王者”、过早庆祝,以及那些悄然消失的结果

2011 年夏天,Miami Heat 为他们签下的三位自由球员——Dwyane Wade、Chris Bosh,当然还有 LeBron James——举办了一场欢迎派对。James 此前刚刚做出“那个决定”,离开自己原来的球队 Cleveland Cavaliers,前往“南海滩”争夺冠军。后来,这段 NBA 历史时刻中最常被人拿来调侃的一幕,就是 LeBron 在回答“这支球队能拿多少个冠军”时说的话。他的回答是:“不是 1 个,不是 2 个,不是 3 个,不是 4 个……”最后大概数到 8 个才停下来。 他们最终拿了 2 次冠军。这本身就是一项困难的成就。但当你的预期被抬得如此之高时,2 次冠军就成了“不是 5 个,不是 6 个……”让人感觉像是失败。甚至在当时,Miami Heat 的球员和球迷就像是在把休赛期当成冠军游行来庆祝。 而一段时间以来,风险投资领域也在上演类似的一幕。一种错位的成就感。在与创始人、pre-seed 和 seed 阶段投资人进行了接连不断的交流,又持续看着一条条行业整合的新闻标题后,这种感觉一直萦绕在我心头。 人们害怕的并不是失败,而是以错误的方式“获胜”。 在早期风险投资领域,有这样一个时刻,看似是突破,实则是陷阱。一家头部机构顺流而下,看中了某样东西,开出一张支票,直接跳过了两轮价格发现。融资以一个要求一切都必须顺利推进的估值成交。创始人欢呼,种子轮投资人也欢呼。而在这一切之下,结果分布却在悄然收窄。 这就是那个无人高声谈论的“造王者”问题。那些知名机构拥有足够强的资本惯性,也有足够大的平台拉力,可以设定一个市场不得不视为真实的估值。这意味着,创始人如今参与的,已经不是他们最初以为自己要玩的那场游戏。而那些最早在无人关注时就辛苦发掘他们的早期投资人,也被裹挟上了一段并非自己选择的旅程。 一家资金充裕的公司以一个只有达到跨代级别规模才能证明合理性的估值融资,却在产品市场契合上栽了跟头,随后不得不连整个投资逻辑都转向,只为维持运转。与此同时,一家更精干的竞争对手,在更短的资金跑道和更强的纪律性下,正悄然在一线胜出。前者融资额高出10到20倍,最终却依然败北。 这背后的账并不复杂,难的是其中的心理机制。更多资本让人感觉拥有更多选择。它可以买来时间,买来人才,买来分发能力。但它也买来了责任。你一旦以一个自己尚未配得上的估值拿钱,就不再是一家朝着产品市场契合摸索前进的公司,而开始变成一家为捍卫那个数字而运转的公司。这是两种截然不同的工作。前一种还留有学习的空间,后一种则没有。 我反复想到的是,这其中很大一部分其实是时机问题。资本本身并不是错误,错误在于节奏。融资过多、过早,在你还不知道什么真正奏效之前就大举筹资,你就会失去中间地带。那些虽不算卓越、却也不错的结果——仍能建立真正的公司、带来真实资本回报的结果——大多会消失。你要么回报基金,要么沦为反面教材。 我一直在向一些投资人学习,他们问的不是“我们怎么走到 A 轮融资?”,而是“A 轮融资能带来什么,又会堵死什么?”这种思路往往会造就这样的创始人:他们先找到契合,再拿到大额支票。 行业整合的 headlines 仍在不断出现。超大轮融资仍在以营收前倍数不断落地。无论牌桌哪一方,参与其中的压力都真实存在。但眼下那些显得更具韧性的公司,并不是那些靠融资融出最多“信心”的公司,而是那些真正赢得这种信心的公司。它们在无人注视之前,就已经以正确的方式赢下了胜利。 唯有如此,根基才站得住。 怀着感激之情, E

一则疯传的末日情景意在唤醒欧洲对人工智能的自满心态 AI
Jun 22, 2026

一则疯传的末日情景意在唤醒欧洲对人工智能的自满心态

一场关于美国在技术领域占据主导地位的思想实验,究竟是在揭示人工智能焦虑,还是同样反映了现实? 现在是 2031 年,美国和中国即将把 Europe 撕得支离破碎。 美国向数据中心投入了巨额资金,而欧盟没有。中国制造了机器人,而欧洲没有。美国企业围绕 AI“重组”了工作流程并裁掉员工,而欧盟员工则悠闲地午休,把行政事务交给 AI 模型 Claude 处理。 如今,报应至少已经开始显现。由于没有自己的 AI,欧洲经济一片狼藉。民粹主义正在高涨,欧元摇摇欲坠,网络攻击正重创欧盟企业。脱欧当初似乎是个好主意。如今看来,这仿佛是欧盟的终局。 至少,这是布鲁塞尔智库人士撰写的一篇名为 “Europe 2031” 的推演性思想实验所描绘的愿景;而它恰好发表于特朗普政府决定禁止“外国公民” 使用 Anthropic 备受追捧的 AI 模型 Fable 的前一天。 在随后那一周气氛高涨的 G7 会谈期间,这一情景迅速走红,进一步推高了围绕欧盟科技主权紧迫性的热烈讨论。欧洲议会议员已读过这份文本,其作者还称,本周早些时候,英德官员之间的 1.5 轨讨论中也提到了它。 其作者表示,外界的关注以及他们的一项预测——美国将限制全球获取先进 AI 模型——似乎一度成真,这让他们感到“得到了印证”。他们希望,这一情景能促使欧洲在 AI 问题上进行一次大刀阔斧的路线纠偏。 这篇文章属于一种日益兴起的虚构 AI 末日情景类型,由一些名不见经传的人物创作,却在过去一年中意外地在政策制定者中广泛传播。2025 年,曾出现过 《AI 2027》这一思想实验 ,其结局是一个超级智能 AI 为建设更多数据中心而杀死全人类;今年 2 月,另一种推演情景则设想 AI 将颠覆美国经济 。(前者曾被美国副总统 JD Vance 阅读,后者则引发了股市一阵波动。) 不过,这一切的一个复杂之处或许在于,他们的思想实验有时基于当前 AI 领域的一些发展,而这些发展的结果仍存在不确定性,甚至令人存疑。 马克西米利安·内格勒表示,他之所以参与“Europe 2031”,是因为布鲁塞尔与旧金山——AI 技术正在那里被开发——之间存在“难以置信的认知鸿沟”。他此前供职于美国智库 Rand,今年离职,专注于这一项目。 “作为一个经常去旧金山并与那里的人交流的人,在我看来,欧洲正在发生的一切就像一场缓慢上演的车祸,”他说。 这一情境是从一位虚构的、眼神明亮的布鲁塞尔职员卡罗琳·杜波依斯的视角展开的。她有一位德国朋友克里斯蒂安·福格特,在旧金山创办了一家初创公司。到访期间,她对美国“每周工作70到80小时”的节奏印象深刻,也对科技圈男士们坚信一切即将发生剧变而感到不安。 回到欧洲后,她努力向那些本意良善的上司鼓吹即将到来的 AI 未来——但未能说服他们。怀疑情绪太重,大多数人都认为 […]

神秘的华尔街巨头 Jane Street 抢占人工智能风头 AI
Jun 22, 2026

神秘的华尔街巨头 Jane Street 抢占人工智能风头

这家公司已从最初寥寥数名员工迅速扩张至3500人,并计划今年再招聘500多名员工。一名工程师表示:“每天都有更多数据产生,而我们对其进行消化和处理的速度也越来越快。” 长期以来,华尔街交易巨头 Jane Street 一直笼罩着一层神秘面纱。其交易员依赖专有算法,因此外界很难理解这家公司如何创造出如此丰厚的利润。它由私人持有,而且只用自有资金进行交易,因此其动向也难以追踪。它还是一家异常扁平化的组织,没有一位居于核心位置的领导人会在商业电视节目上发声,或充当公司的公众门面。 这家公司的办公地点更增添了其神秘色彩。Jane Street 位于世贸中心对面的 Brookfield Place 一栋不起眼的办公楼内,而不是它为自己名字随意选取的那个 Greenwich Village 街道。 如今,随着这家公司力图成为人工智能领域的巨头,它正逐步走入聚光灯下。 Jane Street 成立 26 年来,规模已从创立之初寥寥数名员工,迅速扩张至 3,500 人,而且还希望进一步大幅壮大,计划今年再招聘逾 500 名员工。若想成为人工智能领域的重要投资者,并借助这项技术大幅提升其交易能力,它就需要吸引 AI 初创公司和顶尖人才的关注。 Jane Street 高管表示,他们从未有意打造一家神秘低调的公司。相反,其中许多人是工程师、数学家等,本就不习惯置身公众视野。 “从文化上讲,我们相对封闭,”在 Jane Street 总部接受罕见采访时,负责 AI 投资的 Jane Street 交易员 John Daniel Case 表示,“但我们正向更多面向公众的业务领域扩张。” 这家公司的文化在其 4 万平方英尺的交易大厅里展露无遗:年轻员工——多数为男性——穿着 T 恤坐在各自的交易台前,有些人还穿着短裤和人字拖。一天当中,照明会随着交易员的昼夜节律而变换颜色:早晨是琥珀色,正午是蓝白色,临近傍晚时则泛起琥珀色光芒。 休息期间,员工们会玩电子游戏或打扑克,这也呼应了公司所推崇的极客数学文化。Jane Street 少数为外界熟知的细节之一,是它会给求职者出一些以复杂著称的谜题和难题。 随着 Jane Street 不断壮大,继续避开聚光灯已变得困难得多——其利润如今已超过 Goldman […]

我们生活在一个多模型的世界里 AI
Jun 22, 2026

我们生活在一个多模型的世界里

替代模型如何支持有价值的多模型堆栈,以及我们认为下一个市值超过 100 亿美元的公司将在哪里诞生。 自ChatGPT发布以来的四年间,人工智能领域的核心问题一直是模型之争的最终赢家。随着两大赢家纷纷申请可能高达万亿美元的IPO,这个问题基本有了答案。现在,对于风险投资人和创业者而言,关键问题变成了:未来会有多少种模型被使用?在双寡头垄断格局之外,多模型世界又会带来哪些机遇? 我们最近的人工智能基础设施调查得出了一些初步结果。(在新标签页中打开)结果出乎我们的意料。我们调查的每个团队都在生产环境中运行不止一个模型。60% 的团队运行超过四个模型,50% 的团队预计未来会使用更多模型。因此,尽管过去几年我们一直处于收入和资金高度集中于前沿模型领域的局面,但多模型未来发展前景光明,并有望迎来显著增长。 换句话说,两件事可以同时成立:第一,模型层正在顶层进行整合;第二,围绕模型层的技术栈正在扩展。本文将探讨第二个事实:应该构建什么,以及应该投资在哪里。 是什么因素推动了多车型市场的发展 企业运行多个模型并非出于享受复杂性的考虑,而是出于越来越明显而非越来越不明显的原因。 成本问题开始变得重要起来。 在我们对人工智能原生工程领导者的后续调查中,70% 的受访者预计,在未来一到两年内,代币成本将成为一项关键的预算项目,需要积极管理。优步和其他大型公司都在公开表示要控制人工智能成本。他们计划采用的方法并不新奇:动态切换模型、在本地或自有基础设施上运行模型、更多地依赖开源软件,甚至限制高级模型的使用。从本质上讲,每一种方法都是一种多模型策略。 成本压力并非纸上谈兵。在我们的基础设施调查中,每个代币的成本已经成为人工智能工作负载的最大单一制约因素,甚至超过了GPU可用性、延迟和模型质量。企业采用人工智能是为了加速开发和提高利润率,但一些企业开始意识到,他们现在在代币上的花费已经超过了过去在工程师身上的花费。人工智能应用的第一阶段——买家为性能付费而忽略成本——最终将受到更严格的审查。下一阶段的关键在于如何在每次调用中都使用成本最低且足够好的模型。 开源软件可以限制闭源软件的价格。 一个充满活力且高质量的开源生态系统发挥着重要作用。OpenRouter/a16z人工智能现状报告(在新标签页中打开)从2025年12月起,开源模型将占推理流量的约30%,其中大部分工作将由中国实验室(如DeepSeek、Qwen和Kimi)完成。但更大的影响并非在于份额本身,而在于可靠的开源替代方案的存在对闭源定价的影响。前沿API的价格最终会有一个软性上限:即自托管足够好的开源模型的成本。在新一代推理云平台上,开源替代方案的价格比前沿模型低10倍。无论团队是否选择开源,这种竞争优势都将赋予他们谈判筹码,这在未来与Anthropic或OpenAI的定价谈判中将发挥作用。美国的开源生态系统落后于中国,但从英伟达到推理云平台再到企业,众多美国公司将继续支持开源。 没有哪一种模式能够赢得所有胜利。 想要了解所有车型类别中充满活力的竞争和飞跃式发展, Arena就是最好的例子。(在新标签页中打开)基准测试排行榜。推理、代码生成、多模态接地和延迟这几个方面,每个指标的领先者往往都不一样,而且每月都在变化。如果整个技术栈都只用一个模型,就意味着要在三四个维度上做出牺牲,才能在一个维度上取得优势。企业团队不会接受这种权衡,尤其是在用例变得越来越复杂的情况下。他们会根据具体任务来选择模型。在我们进行的基础设施调查中,26.3% 的团队表示,在生产环境中管理多个模型是他们面临的最大基础设施难题,这本身就足以证明他们正在这样做。(参见Arena)(在新标签页中打开)(涵盖 10 多个不同类别的实时排行榜。) 展望未来,我们调查的工程领导者中有70%预计两年后使用的模型数量将与现在相同,甚至更多。模型战略的发展趋势并非趋向整合,而是趋向增长。 对双寡头垄断的持续竞争 人们很容易将此解读为一个过渡时期:两大巨头不断吸引资本和人才,挑战者逐渐式微,客户最终会选择一家提供所有服务的主要供应商。但我们认为事情远未结束。其原因主要在于结构性因素,而非模式质量: 资本正在以公共云时代前所未有的方式为长尾市场提供资金。 由于构建超大规模云平台所需的资本支出高昂,且云服务之间的转换成本也很高,云计算领域最终只剩下三大赢家。人工智能领域也存在一些相似之处,但也存在一些关键差异,例如如今的替代方案资本支出更低,转换成本也更低。可以说,最大的区别在于用于推动持续竞争的融资规模。像 xAI、SSI、Mistral、Cursor 以及 Flapping Airplanes 和 Recursive Superintelligence 等资金雄厚的竞争对手,其规模在十年前足以建立起可靠的基础设施公司。Runway(视频)、Black Forest Labs(图像)和 Eleven Labs(语音)等特定领域的领导者,进一步加剧了竞争。再加上谷歌的 Gemini 项目以及未来任何大型科技公司的尝试,如果 Anthropic 或 OpenAI 的价格优势过于明显,客户完全可以找到其他选择。 推理市场需要两家以上的模型公司来满足需求。 像 Fireworks、Baseten、Modal、Deep Infra 和 Together 这样的推理服务提供商,其业务模式建立在客户希望在不同地区以不同的成本和延迟运行不同模型的前提之上。如果世界最终只剩下两个各自独立运作的推理实验室,那么整个推理层要么消失,要么实力削弱。Baseten 的估值曾被炒至 110 亿美元,Together […]

开启新工业革命 AI
Jun 22, 2026

开启新工业革命

第一次工业革命由蒸汽驱动——以煤炭为动力的蒸汽机将机械能变成了充裕资源。数字时代则是一场连接性的革命;它让信息更加丰富,从而催生了新一波创造力。 人工智能是一场智能革命。预计它将达到人类水平的智能,并随后超越人类。它应该有潜力像过去的革命那样,显著提高生活水平。 但问题在于:这种智能被困住了。 工业基础设施不足和物理限制正威胁着把 AI 的潜力继续束缚住。要真正释放这场智能革命,我们需要重新思考工业化路径——从电力到基础设施,再到物理 AI。 看似反直觉的是,这反而为初创企业创造了巨大机遇。它们并不在模型层面与超大规模云服务商竞争,而是下沉一步:重新思考这些前沿实验室自身所需的电力与材料。  这堪称高明之举:超大规模云服务商愿意投入前所未有的资金来释放其智能。初创企业无需与这种分发优势正面竞争,而是可以通过重建工业栈,来满足对电力和材料新增且不断增长的需求,并从中受益。 为什么智慧被困住了? 要想切实改变人类生活水平,需要三个投入要素:  能源 + 智慧 + 协同行动。  让我们以第一次工业革命为例。1760 年代之前,经济学家估计,在超过 800 年的时间里,几乎不存在真正的经济增长。这并不是因为缺乏技术。印刷机——在互联网出现之前最具影响力的知识传播系统——发明于 15 世纪 40 年代。风车和水车——利用自然能源的方法——自中世纪以来就已存在。 然而,直到 18 世纪晚期,GDP 增长曲线仍未出现加速上扬。 那么,为什么没有增长?当代思想家、作家 Thomas Malthus 认为,这些各不相同的技术带来的产出增长,被人口增长所抵消。我们的产出永远无法超过人类的消费,从而使社会始终停留在仅能维持生计的水平。 关于究竟是什么让我们摆脱了这一陷阱,有许多不同看法,但其中一种对当下尤其具有现实意义:问题不在于缺乏创新,而在于缺乏协调。最终打破马尔萨斯陷阱的,不是某一项单独的发明,而是将动力、智慧与协同行动整合为可规模化系统的过程。 让我们逐一来看。 首先,是动力。1769 年,James Watt 获得蒸汽机专利 。这改变了动力的应用方式。在蒸汽机出现之前,纺织厂必须坐落在湍急河流旁。蒸汽机出现之后,工厂可以建在城市里,更靠近劳动力和市场。而且,持续运转机械在经济上也变得可行。 但没有创新的动力,终究只是潜力。这就引出了第二个要素:智能。 随着动力供给的释放,纺织业出现了迅猛的并行创新。珍妮纺纱机让位于水力纺纱机,最终又发展到机械化动力织机。技术不断演进,以利用这一新的底层动力供给,提高了每名工人的生产率。 如今,新技术已经出现,并且有足够的动力来支撑它。这催生了第三个必要的变化:劳动力的重新组织,或者如我们所说的,“协同行动”。 在为水力纺纱机(动力织机的前身)申请专利后不久,Richard Arkwright 创立了工厂模式,以实现产出的标准化并提高生产率。这些新技术在规模和生产率上的巨大提升,要求对工作本身的组织方式进行重构。 工厂的出现提高了生产率,但也带来了巨大的二阶和三阶效应:城市化的兴起(从而加速了知识共享),以及生活水平的提高。 动力 + 智慧 + 协同行动。这就是公式。 动力让一切成为可能。智能则将这股力量导向有价值的结果。行动则以此前难以想象的规模将其付诸实施。 而这正是当今人工智能面临的问题所在。在美国,我们拥有智能,但我们严重缺乏动力和行动。 要充分释放人工智能所带来的全部潜力,我们需要两样东西: 重建并现代化连接物理世界与数字世界的基础设施。 创造新的协调性身体动作形式。 第一个机会:动力 电力需求令人难以招架。我们用了几个世纪才达到当前约 1,200 吉瓦的装机容量。但我们还需要更多。美国能源部估计,到 […]