# AI

共 229 篇相关文章

你的数据智能体需要上下文 大模型内核
Mar 23, 2026

你的数据智能体需要上下文

作者:Jason Cui & Jennifer Li | 来源:SandHill.io 你的数据智能体需要上下文 URL: https://www.a16z.news/p/your-data-agents-need-context 是时候开始构建了。 超过 220,000 名订阅者 你的数据智能体需要上下文 市场已经意识到,没有合适的上下文,数据和分析智能体基本上是无用的 关于上下文的上下文 最近,在数据和 AI 智能体的世界里,上下文层和图已经成为一个有趣的讨论话题。事实上,如今与一个处理数据和 AI 的组织进行对话,很难不谈及上下文这个话题。 这是有充分理由的。在过去的一年里,市场已经意识到,没有合适的上下文,数据和分析智能体基本上是无用的——它们无法理清模糊的问题、解读业务定义,以及有效地跨不同数据进行推理。 当然,这不是它们的错。现代数据栈经历了十多年的转变,从分散的数据源到整合的数据和清晰的定义(这是好事),但即便如此,整合也从未完美,并且引入了大量的混乱。市场的总体演变如下: 1) 现代数据栈的兴起 – 我们过去曾与 dbt 的 Tristan Handy 以及在我们自己的参考架构中探讨过现代数据栈的变革性崛起。过去十年的总体演变已经改变了数据架构,涵盖了数据摄取、转换、仓储和存储,以集中化数据并使其能够快速便捷地访问。其理念是,有了清晰组织的数据,团队就可以简单地编写 SQL 从他们的数据仓库中派生数据,驱动图表/仪表盘,并在整个组织内实现商业智能。 2) 智能体狂潮 – 随着 LLM 能力在 2024 年至 2025 年间的增强,几乎每个组织都希望在他们现有的数据栈之上构建和部署智能体。我们之前已经讨论过我们如何定义智能体,但从组织的角度来看,以更高效率和更少时间完成更多工作的天然吸引力,自然而然地导致了向智能体工作流的倾斜。公司试图构建“与你的数据聊天”的聊天机器人、支持智能体等。这场狂潮既是自下而上的,也是自上而下的——开发者希望利用最新、最炫的 LLM 功能,而领导层则施加 AI 采用的压力,以增加自动化并降低成本。 3) 撞上南墙 – 尽管最初很乐观,但很快就清楚了,这些努力大多都失败了。组织试图部署他们的智能体,但却撞了南墙。麻省理工学院(MIT)著名地发布了他们的《2025 年商业 AI […]

我们需要谈谈“代理”(Agents) AI
Mar 23, 2026

我们需要谈谈“代理”(Agents)

作者:Euclid Team | 来源:SandHill.io 关于 AI 和自动化的辩论常常在两个极端之间摇摆:一边是兴奋地宣称 AI 将在本十年末取代所有知识工作者,另一边是焦虑地担忧企业 AI 试点项目步履维艰,未能提供切实的经济价值。这两种观点都未抓住要点。 越来越清晰的是,那种“AI 取代工人”的美好图景并不成立。将 AI 与招聘放缓联系起来的证据充其量是混乱的,而关于生产力提升的说法一直难以衡量(有些甚至被现有数据证伪)。将裁员“AI 化”——高管们利用 AI 自动化试图将裁员的负面含义转变为积极的股东叙事——已变得普遍。 但这并不意味着 LLM 时代的 AI 不具备根本性的变革力量,也不意味着其经济潜力已经见顶。我们只是处在应用初级阶段。人们很容易忘记,从个人电脑商业化(由 IBM 于 1981 年实现)到世纪之交数字生产力繁荣的顶峰,中间有 20 年的间隔。¹ 当前 AI 自动化叙事的单一性很容易解释:激励、激励、再激励。在 AI 对劳动力影响问题上,声音最大的人往往是获益最多的人——从运营前沿实验室的高管,到在后 2021 时代调整劳动力的 CEO,再到为了证明不断增长的资产管理规模(AUM)而大肆宣传的 VC。 但这正在成为一个问题。 “代理主义”的教堂 夸张的 AI 叙事已经从高层次的经济论断升级为产品定位本身。现在,每一个由 AI 驱动的功能都被称为“代理”(agent)。会议小组希望讨论“管理你的 AI 劳动力”。每一个企业买家都被告知他们需要“数字同事”。创始人们给他们的代理取名字、赋予个性,甚至人类面孔。一些创业公司甚至根据候选人思维模式的“代理性”来评估他们。 “代理”这个词——一个本身就很模糊的词,意为“行动者”——正开始在其无所不在的重压下崩溃。虽然它的兴起至少部分是由于希望让 AI 对企业来说更易于理解和更具紧迫性,但它可能正在产生相反的效果。当一切都成为“代理”时,买家几乎不可能分辨出任何特定产品究竟是做什么的,它如何融入现有运营,他们应该如何与之互动,或者为什么它对他们的利润至关重要。在垂直 AI(Vertical AI)领域,这尤其具有灾难性。 虽然在某些垂直领域,探索性或表演性的 AI 应用是真实存在的²,但大多数行业买家并不关心 […]

为什么世界仍在运行 SAP 企业级应用
Mar 23, 2026

为什么世界仍在运行 SAP

作者:Eric Zhou & Seema Amble A16Z | 来源:SandHill.io 借助 AI,初创公司及其客户已将注意力集中在全新的功能及由此衍生的产品上。想想那些闪亮的新语音代理、工作流自动化工具和文本到应用平台。 虽然这些领域已经并将继续涌现许多激动人心的企业(我们已投资其中几家!),但 AI 将在一些远不那么光鲜亮丽却价值连城的事情上产生巨大影响:帮助企业从其已经运行的大量软件中获得更多价值。在此,我们不妨提出一个听起来近乎冒犯的问题,直到你在一家财富 500 强公司待上一周后才会明白:为什么人们还在使用 SAP(以及 ServiceNow 和 Salesforce)? 简而言之,SAP 或任何大型的传统记录系统,都捕获了使用它的企业中的关键数据。但更重要的是,企业已经对其进行了定制,并在其之上建立了一套特定的流程和角色,而其中大部分内容实际上并未在任何地方被记录下来。迁移系统的过程一直很痛苦、昂贵且耗时——通常需要一支庞大的顾问团队、数年时间以及数亿美元的资金。从 SAP ECC 升级到 SAP S4HANA 可能耗资 7 亿美元,耗时 3 年,并需要一支来自埃森哲的 50 人团队。而且在迁移之后,该软件几乎只能用于生成无法操作的只读报告。 直到现在,情况才有所改变。AI 释放了升级、定制、替换以及更坦率地说,更好地访问和使用这些记录系统中捕获的数据的机会。 最终,AI 的目标可能不是“取代 SAP/ServiceNow/Salesforce”,而是让它们变得更具可编程性和更易于使用。赢家将是那些(1)利用可衡量的风险和时间缩减来接入转型预算,然后(2)作为可信赖的工作控制平面扩展到日常运营中,逐步将传统 UI 分解为可组合、受治理、AI 辅助的行动和轻量级应用的平台。换句话说,记录系统将继续存在;而接口、自动化和扩展层将成为新的软件前沿。 SAP 令人痛苦,但我们仍在使用它 为了更好地说明这一点,让我们先简单介绍一下 SAP 及其功能。从表面上看,这些系统难以驾驭,修改起来很痛苦,但不知何故,它们仍然是全球最大型组织运营的支柱。想象一下使用 SAP 是什么样子! SAP interface 但那个“不知何故”正是机会所在。 那个令人不安的答案是,在丑陋的 UI 和无尽的配置之下,这些系统非常强大:它们编码了企业的规范数据模型、保持合规性的权限和控制、使其能够大规模运营的工作流,以及连接数十(或数百)个下游流程的集成。它们不是消费者意义上的“应用”,而是以表格、角色、审批、过账逻辑和异常处理形式表现出来的累积的机构记忆。 替换这一切不仅仅是昂贵;它还充满风险。一家公司投入得越多——自定义字段、工作流、定价规则、报告逻辑——这个系统就越成为转换成本的护城河和竞争优势。这也是为什么可扩展性如此强大的原因:每个企业都是独一无二的,变化是永恒的(新法规、新产品、新组织结构),而这些平台之所以能够生存,是因为它们可以被改造以适应现实。挑战在于,正是这种使它们变得有价值的可扩展性也使它们变得脆弱:每一次定制都成为未来升级的隐患,每一个工作流都成为一个迷宫,每一个屏幕都成为每个必须使用它的人的负担。 […]

互联网毁了客户服务,AI 或能拯救它 企业级应用
Mar 23, 2026

互联网毁了客户服务,AI 或能拯救它

作者:Sarah Wang | 来源:SandHill.io 互联网毁了客户服务,AI 或能拯救它 公元前 1750 年,一位名叫 Nanni 的商人在古城乌尔坐下来,口述了世界上第一封已知的客户投诉。这封投诉刻在了一块只有手掌大小的泥板上——如今这块泥板收藏于大英博物馆——Nanni 对一位名叫 Ea-nasir 的商人表达了他的愤怒,后者承诺提供优质铜锭,结果却交付了“质量不佳的铜锭”。“你把我看成什么人了,”Nanni 写道,“竟敢如此轻蔑地对待我这样的人?” 近四千年后,Nanni 的感受已是普遍现象。读到这篇文章的每个人都曾在某个时刻扮演过 Nanni 的角色。你,亲爱的读者,曾为了解决一个问题而等待人工客服 45 分钟。你曾被转接到另一个部门。你曾对着自动电话系统大喊“人工服务”。你曾愤怒地向一个不智能的聊天机器人输入文字,而它根本不被设定为能理解你为何生气。媒介可能已经改变,从泥板到电话系统再到工单队列,但那种情绪自古未变:你把我看成什么人了,竟敢如此轻蔑地对待我这样的人? 奇怪的是——当企业在其他所有方面都做得越来越好时,客户体验却变得越来越糟糕。这是互联网时代的一大讽刺。互联网帮助商业无限扩展:一键下单、次日达、几乎所有消费品都有海量选择。但它却让作为一名顾客的体验变得糟糕得多。一个企业服务的顾客越多,单个顾客得到的关注就越少:因为虽然物流可以指数级扩展,但专注的客户关怀——那种确保你对体验感到满意的真正关怀——却只能线性扩展。也就是说,它取决于企业雇佣的员工数量。 对于任何在线销售商品的企业来说,一个不可避免的事实是,客户服务是一个需要最小化的成本中心,而不是一段需要深化的关系。每个顾客都变成了一个工单号、一个案例 ID、一个无尽队列中的位置。这并非因为今天的企业比 100 年前或 4000 年前的企业更不在乎顾客。这仅仅是因为专注的关怀无法规模化。 直到现在。 消费品企业有两种类型 你可以认为消费品企业分为两种类型。 第一种,我们称之为规模化企业。这是互联网的天下。比如 Amazon、Uber、Airbnb、你的航空公司、电信公司、银行。这些企业每年为数千万甚至上亿人提供服务。它们在物流、价格、选择和便利性方面表现卓越:最重要的是,它们深谙规模化的艺术。 但它们必须管理的巨大体量意味着每个独立的客户关系都很薄弱。这是一个数学上的必然;当你需要应对数量庞大到难以想象的人群时,情况只能如此。你面对的是交互式语音应答(IVR)电话系统、工单队列、决策树式的聊天机器人。结果就是,无论人们多么需要或喜欢这些公司提供的服务,他们都讨厌自己得到的客户服务——以至于“跟客服打交道”几乎成了“我不得不忍受的烦心事”的代名词。这很合理:每天至少有相当于 366 个人一生的时间被浪费在仅仅是处理作为顾客的头疼事上。大约四分之一的美国人表示,他们宁愿剃光头也不愿跟客服打交道。 但对于一小部分人来说,还存在另一种消费品企业。我们可以称之为管家式企业。比如你的 Hermès、你的 Porsche、你的豪华酒店、你的行政体检、你的 Global Services 热线。这类企业围绕着管家这一角色组织——一个了解你、记得你的偏好并能预见你需求的人。“您上次喜欢那款波尔多红酒;或许您会喜欢这款国产多瑞加?” 管家服务是迄今为止设计出的最高形式的客户体验:无处不在、主动积极、个性化、持续不断。它不像大众化的“客户服务”那样是片段式的。你不会只在出了问题、心情不好的时候才和管家交谈。这种关系是持续的。你感觉自己更像一位被仆人簇拥的旧式贵族,而不是一个焦头烂额的顾客。 这种与众不同的感觉正是其吸引力的重要组成部分。管家式体验不仅在功能上更胜一筹,在社交层面也更优越。它表明你并非芸芸众生中的一员,在电话系统中苦苦挣扎。你存在于一个独立的、更文明的世界里,那里有人知道你的名字和偏好,并把你的时间视为宝贵的。这种专属感是奢侈品牌刻意培养的:管家不仅为你提供优质服务,还让你感觉自己与众不同。 顺便说一句,管家式企业和规模化企业之间的区别并非道德上的。Bernard Arnault 对赚钱的关心程度不亚于 Jeff Bezos。区别仅在于 ARPU(每用户平均收入)。一个专注的、高质量的管家需要真金白银——人力成本高昂,当然,如果再算上培训和机构记忆的成本,就更加昂贵。在不同的 ARPU 水平下,“客户服务”对企业来说扮演着完全不同的角色。对于一个低 ARPU 的规模化企业,客户服务只是一个成本中心;而对于一个奢侈品企业,客户服务就是一切。 Hermès […]

50 家以实体 AI 改造行业的初创公司 具身智能
Mar 23, 2026

50 家以实体 AI 改造行业的初创公司

作者:Bessemer Team | 来源:SandHill.io 50 家以实体 AI 改造行业的初创公司 经过数十年的期待,在 AI 和硬件突破的推动下,自主系统和机器人正从实验室走向工厂车间和家庭。 AI 与机器人的融合正在重塑每一个可以想象的行业,从国防、制造到医疗保健和消费者体验。在我们于旧金山举办的首届机器人日(Robotics Day)上,我们聚集了智能自动化和机器人领域的创始人、建设者和研究人员。这些专家与我们的投资团队一起,探讨了从纯软件 AI 系统到具身智能(embodied intelligence)的根本性转变——即机器能够在动态环境中观察、理解和行动。这一转变代表了我们这一代最重要的技术拐点之一,其应用涵盖自动驾驶汽车、国防系统、农业等领域。 在我们的最新研究中,机器人市场正经历爆炸性增长,这主要由三个关键因素驱动:AI 基础模型的突破性进展,带来了更好的感知和决策能力;硬件成本的大幅降低;以及关键行业严重的劳动力短缺。预计到 2035 年,全球将有超过 25 亿个机器人,但这个数字低估了真正的机遇——随着机器人变得更加强大和通用,它们将创造全新的市场,而不仅仅是自动化现有的工作流程。 引领这场革命的公司具有一些共同特征: 拥有世界一流的技术团队,结合了机器人、AI 和系统工程专业知识 专注于高价值、可重复的应用场景,以证明部署实体系统的复杂性是合理的 与客户建立深度合作关系,客户可以提供持续改进所必需的真实世界数据 最重要的是,这些公司正在构建集成了硬件、软件和 AI 的全栈解决方案,而不是仅仅押注于纯软件或商品化的硬件。 50 startups transforming industries with physical AI 塑造机器人和自主系统未来的公司 尽管机器人行业尚未迎来“ChatGPT 时刻”,但自主系统和机器人的进步已经取得了商业上的成功,影响着我们的日常生活。在对行业格局进行考察时,我们发现 Waymo 和 Anduril Industries 这两家公司是无可争议的领导者,它们清晰地展示了创始人将实体 AI 研究转化为新应用、从而改变各自行业的可能性。 我们总共确定了 50 家最具潜力的私营公司——我们相信这些创新者将定义实体 AI 的下一个十年。这些公司代表了几个关键类别中智能自动化的先锋: 自动驾驶汽车 自动驾驶交通的竞赛持续加速,应用范围从长途货运到最后一英里配送,再到共享出行。 […]

AI 的火箭燃料 深度学习
Mar 23, 2026

AI 的火箭燃料

作者:Astasia Myers GP @ Felicis | 来源:SandHill.io Reinforcement Learning Agent-Environment Loop 对于 AI 平台的转型而言,强化学习就是火箭燃料。 在过去的六个月里,新一波强化学习(RL)技术一直在积聚势头。两个独特但互补的趋势脱颖而出:大规模可扩展的 RL 环境和“强化学习即服务”(RLaaS)云平台。这些创新有望改变 AI 系统的学习和适应方式,从静态训练转向动态的、持续的改进。 在 Mercor 等公司不断推动 RL 促进 AI 发展的边界的同时,像 Kaizen、Mechanize 等平台正试图让使用 RL 变得像启动虚拟服务器一样简单。 鉴于 RL 的巨大重要性,理解这些技术各自包含什么、它们为何在增长,以及它们为 AI 的未来提供了怎样的机遇,都至关重要。 RL 的时刻:从静态模型到动态学习者 今天大多数的 AI 模型都是在巨大的数据集上训练一次,然后就固定不变。它们能力非凡,但也是静态的。一旦训练完成,它们不会轻易地自行改进或适应新任务。RL 为超越这一局限性提供了一条路径。在 RL 中,一个 AI 智能体通过与环境互动来学习,尝试不同的行动,并接收反馈(奖励或惩罚)来完善其行为。 这种试错循环可以产生动态的、自适应的智能体,它们能从经验中持续学习。其前景是,AI 不再仅仅是复述训练数据,而是能通过实验真正弄清楚如何完成目标,无论是控制机器人、优化业务流程,还是编写软件功能。 当奖励是可验证的(正确或不正确)时,RL 最为成功,例如在软件开发和数学领域。对于更复杂的场景,其中正确性可能更具主观性,像 OpenAI GPT-5 这样的团队使用一个通用验证器,该验证器通过使用各种来源进行研究,逐步验证正确性,从而自动检查和评分另一个模型的输出。通用验证器对于将 RL 扩展到正确性更模糊的新用例至关重要。 然而,大规模利用 […]

世界模型:计算不可计算之事 AI
Mar 23, 2026

世界模型:计算不可计算之事

“我本想昨晚睡着。结果我开始想象第二天可能遇到的各种情形,以及我可能如何应对它们。” 这是一个普遍的体验。作为人类,我们很容易想象,不论是复杂的体育场、可能的恋情,还是激烈的争论。我们并不需要比想象与认识多年的朋友交谈更多的努力去设想自己在下一场曼联比赛的情形,尽管想象一场曼联比赛包含对成千上万人的行为进行模拟和建模,而这对于如今的传统计算机和游戏引擎来说将需要数年时间 1. 想想写代码来描述那场曼联的比赛:在任何时刻,某个球迷可能会带来一面随机自制的旗帜。整个球场开始唱与之相关的歌曲。但并不是所有人都会跟唱;有些人会和孩子一起跳跃,而一对老夫妻静静坐着,想知道这是否是他们最后一次一起看球,默默地享受每一秒。 世界是一个意外的未来展开之地,但以某种可预测的方式展开。 作为人类,我们几乎能以相同的努力、用大致相同的时间设想出几乎所有这些未来。计算机做不到。 难怪传统计算在应对这种复杂性时显得力不从心。试想要预测并编写每一个动作以及所有这些动作之间的相互作用。在传统引擎中,从数学上讲,模拟 N 个球迷至少是一个 O(N) 或 O(N2) 问题。每个人、旗帜、椅子和球都必须被明确计算——而且,实际上,它们之间的相互作用也需要被计算。 在机器人领域,机器必须在实际世界中对情形做出相同时间量的响应,而不论其复杂程度如何,尽管在传统计算中,不同情形的模拟时间可能相差甚远。这一直是机器人和具身人工智能进展的一个主要瓶颈。 世界模型 是解决该问题的一种方案。 世界模型通过视频以及常常包含的视频中采取的行动来学习预测这些动态。它们将那些动态的、在大规模下难以模拟的情形——包括像足球比赛这样带有随机性并依赖行动的群体行为——简化为神经网络中的一次固定代价运算。 在世界模型中, 整个球场被模拟成通过神经网络一次固定代价的前向传递。场景的复杂性并不会在推理时成倍放慢“引擎”,因为权重已经在训练中吸收了世界的模式。 怎么做到的? 行动。 动作作为压缩的一种形式,用以预测展开的动态: 它们包含了展开环境中未来状态所需的信息,直到有更多动作发生并向环境中添加新的输入。每个动作都携带足够的信息来预测接下来会发生什么,直到下一个动作更新画面。 这种 “受行动驱动” 的方法使模型能够进行交互式学习与规划。如今,即便在最好的模拟引擎中,这在计算上也是难以实现的,且绝非以可预测的计算成本可行。行动帮助模型像我们一样与世界互动。 一次又一次,每一天,你观察,你计算,决定该做什么,然后行动。这就是生活。在任何时刻,关于时空的所有已收集信息都会塌缩为你采取的行动。 对于计算机而言,行动是一种绕过模拟成本的作弊码 。如果人类大脑比最先进的 LLMs 高效得多,那么我们可以通过观察人类如何应对环境中无数变量,几乎免费地获得所有那些计算。这为我们提供了一种高效进行非确定性计算的方法,并创建在传统计算约束下不应可能实现的模拟。 这种 “计算不可计算之物”的能力正是我们认为 World Models 将以当前模型架构无法做到的方式推动具身人工智能进步的原因。 把模型想象成梦。 你是否曾做过这样一个梦:你只是站着观看发生的一切,却无法干预? 那就是视频模型 。 现实世界有所不同。它会对你的行为或指令做出响应,并预测可能发生的全部情况,而不仅仅是最可能或最具娱乐性的下一帧。 你是否曾做过清醒梦,在那种梦境中你能够塑造心灵生成的梦境故事? 那就是世界模型 。 我写了一个对比程序,你可以在 这里 试玩。 更正式地说,标准视频模型根据概率 P(xt+1 | xt) 预测下一帧, 而世界模型则基于干预 预测下一状态,P(st+1 | st, at). 那 at 在时刻 t 的动作,是关键所在。 在总体直觉中,我们认为(并已看到早期迹象)世界模型是比 LLMs 更为新颖且可能更强大的基础模型类别,适用于需要深度空间与时间推理的环境。像我们的现实世界这样的环境。 世界模型——这些通过观察世界及其中的行为而学习的系统——是一种根本上全新的基础模型。它们能够计算以前无法计算的事物。 它们的重要性将远超目前任何人的预料,因为它们提供了一条仅靠语言和代码无法实现的通向通用智能的路径。毕竟,做为人类,就是在一生中基于我们所经历、观察和学习的内容采取行动 。 且慢。你或许会对这一说法感到困惑——World Models 提供了 LLMs 无法实现的通向通用智能的路径。这样的困惑是可以理解的。 World Models 最近备受关注。一直对 LLMs 是否通向通用智能持怀疑态度的 Yann LeCun 刚刚宣布 他为 AMI 募集了 10.3 亿美元。Fei-Fei Li […]

数千人出卖身份以训练人工智能——但代价几何? AI
Mar 23, 2026

数千人出卖身份以训练人工智能——但代价几何?

全球数以千计的 AI 训练师正在把自己生活的瞬间(包括电话和短信)出售给 AI 公司以换取快钱 去年某个早晨,Jacobus Louw 像往常一样出门在社区散步,顺便喂沿途的海鸥。但这一次,他录下了几段自己脚步和在人行道上行走景象的视频。那段视频为他赚了 14 美元,约为该国最低工资的 10 倍,或对这位 27 岁、居住在开普敦的南非人来说,相当于半周的生活食材费。 这段视频是 Louw 在 Kled AI 上找到的一个“城市导航”任务的内容。Kled AI 是一款通过付费让贡献者上传数据(如视频和照片)来训练人工智能模型的应用。几周内,Louw 通过上传日常生活的照片和视频赚了 50 美元。 数千英里外的印度兰契,22 岁的学生 Sahil Tigga 经常允许 Silencio(该平台为人工智能训练众包音频数据)访问他手机的麦克风,录下餐厅内或繁忙路口等环境噪声,从而赚取报酬。他也会上传自己的声音录音。Sahil 会特地前往尚未出现在 Silencio 地图上的酒店大堂等独特地点采集音频,每月收入超过 100 美元,足以覆盖他的全部餐饮开支。 在芝加哥,18 岁的焊工学徒拉梅里奥·希尔通过将自己与朋友和家人的私密手机聊天出售给会话式人工智能训练平台 Neon Mobile,赚了几百美元;该平台按每分钟 0.5 美元付费。对希尔来说,算术很简单:他认为科技公司已经获取了他大量私人数据,不如自己也分一杯羹。 这些零工式的人工智能训练者——他们上传周围场景以及自己的照片、视频和音频——处于一场新的全球数据淘金热的最前线。随着硅谷对高质量、具人体等级的数据的需求超过了公开网络抓取的供给,一批繁荣的数据市场行业应运而生以填补这一空白。从开普敦到芝加哥,数以千计的人现在通过微许可的方式出让他们的生物特征身份和私密数据,用以训练下一代人工智能。 但这种新的零工经济也有代价。以几美元为酬,其训练者正在助力一个最终可能让他们的技能变得过时的产业,同时也让其中一些人面临只刚刚开始理解的深度伪造、身份盗窃和数字剥削的未来风险。 维持 AI 运转 像 ChatGPT 和 Gemini 这样的 AI 语言模型需要大量学习材料来改进,但它们正面临数据干旱。最常用的训练来源,如 C4、RefinedWeb […]

AI
Mar 16, 2026

模型实验室盈利能力的辩护

作者:Jamin Ball, Partner @ Altimeter 模型实验室盈利能力的辩护 关于人工智能公司,似乎存在无休止的争论,它们是会拥有“倒挂的损益表”而永远亏损,还是会在未来变成摇钱树。无论是针对OpenAI和Anthropic这样的大型实验室,还是Cursor这样的初创公司,我总是听到这种说法!我不知道是看空者只是想证实他们对人工智能负面情绪的先入之见,还是看多者只是盲目天真的乐观,抑或是有人真的有基于真实分析的观点。作为一名早期风险投资人,我当然属于“永久乐观”阵营,所以你可以对这篇文章进行适当的过滤 🙂 但在这篇文章中,我想重点关注围绕大型实验室的盈利能力辩论,以及为什么我认为它们会变成利润丰厚的业务。 这场辩论主要有三个部分:1)毛利率,2)训练成本,3)留存/商品化。“人工智能实验室永远不会盈利”的人会声称实验室的毛利率结构性受限,训练越来越大的模型(无论是资本支出还是运营支出)的“仓鼠轮”将永远导致自由现金流为负的业务,并且从一个模型切换到另一个模型的成本非常低。所以(正如看空者所说),即使你能解决这三个问题中的一个,你也永远无法解决所有三个,因此这些业务永远不会盈利。 首先,我想通过分析基础设施软件公司(如Confluent、Snowflake、Mongo等以及超大规模云服务商)的盈利能力多年来的演变来为这场辩论奠定基础。这在很多方面都是一个不完美的类比,但我认为以此作为开端很有帮助。 让我们从毛利率开始,因为这是我对此辩论中最有信心的一部分(有人可能会将我的观点描述为“天真地确定” :))。几乎所有基础设施软件公司最初的毛利率都是负的,然后随着规模的扩大,毛利率会达到60-70%的范围。为什么基础设施公司通常以负/非常低的毛利率开始呢? 你以零售价购买基础设施,然后以折扣价出售。 早期你与云提供商没有规模优势。你为计算/存储支付标价(或接近标价),但你为了赢得客户而积极地为你的产品定价。这种数学设计上是倒挂的,你正在补贴采用。 利用率很差。 你为尚未拥有的客户预留了容量。你的集群以10-20%的利用率运行,但你却支付100%的费用。每个新增客户都会改善这个比例,但早期你正在消耗闲置容量。 启动新云区域的固定成本。 早期,你可能只在一个云的一个云区域提供你的产品。“AWS East。”随着时间的推移,你增加了更多的云和更多的区域。增加新区域(甚至增加更多云)有真实的固定成本。早期,你将这些成本分摊到非常少的客户身上。随着客户群的增长,你可以将这些年度固定成本分摊到更广泛的客户群中。 产品尚未优化。 早期的基础设施产品是为了快速上市而设计的,而不是为了效率。查询是浪费的,存储没有正确分层,缓存层尚不存在。工程团队专注于功能,而不是成本优化。“先让它工作,再让它快速”的循环意味着早期成本被夸大了。 还有更多,但这些是我能想到的前几个。结果呢?每家公司都解决了所有这些问题,毛利率也随之可预测地增长……如果说我在评估早期基础设施公司时几乎从不担心的一件事,那就是它们的毛利率…… 现在让我们看看模型公司。早期的一个巨大打击是“它们的毛利率很糟糕!它们永远不会盈利!”但这些模型公司面临着许多与经典基础设施公司相同的挑战,而且它们已经显示出类似的扩张趋势。《The Information》最近报道称,Anthropic在2024年的毛利率为-94%,目标是2025年达到约40%的毛利率。我不会评论这些数字的有效性,但趋势应该非常清楚……实验室是如何实现这样的利润扩张的?它们的模型架构不断改进,服务变得更高效(想想添加提示缓存之类的东西)。它们在后台自动扩展和利用GPU的效率更高。总的来说,随着架构变得更高效,每个token的推理成本急剧下降。 我认为边际推理调用已经相当毛利率可观。我的合伙人Clark发布了一篇关于这方面的分析,你可以在这里找到。我还认为,实验室很有可能在未来提供更高毛利率的产品(如应用程序、广告等)。我真的不担心实验室的毛利率会结构性地低于云时代的经典基础设施公司。 关于“这些公司永远不会盈利”的第二个争论围绕着训练成本。云基础设施公司在这里没有真正的可比对象。然而,在我看来,真正的问题更多地在于收回训练成本需要多长时间。为此,我们确实有一个云基础设施公司的类比——它们的销售和营销回报(或者我喜欢称之为CAC回报)。对于CAC回报,以及从“盈利能力”角度来看什么是可持续的,我们已经很清楚什么是优秀、良好、糟糕的。为了定义这个指标,CAC回报计算为:“如果你花费x美元获取一个客户,需要多少个月才能从该客户那里产生x美元的累计毛利润。”任何少于12个月的都是极好的,12-24个月是好的,24-36个月是可以接受的,超过36个月就会变得棘手(这些是我通常适用于早期公司的一些非常普遍的经验法则。随着公司规模越来越大,这些指标的相关性会降低)。CAC回报小于24个月的公司已经显示出能够实现巨额自由现金流盈利的能力。这个指标之所以相关,是因为在你收回了获取成本之后,该客户未来的所有毛利润都应该主要直接流入利润底线(同样,这是一个大致的说法,并不完全准确,但方向上是正确的)。 因此,与实验室的正确比较是“你的预训练回报期是多少”,更重要的是,随着你发布未来的模型,这个指标的趋势如何。计算“训练回报期”的方法是查看训练模型的全部成本,然后计算需要多长时间才能产生等量的毛利润。在不涉及私人数据的情况下,我可以说实验室训练回报期的动态与基础设施公司的CAC回报期并没有太大不同。我完全相信训练回报期根本不会那么长。 对此有两点反驳。 基础设施公司的CAC回报是一次性的。你花一次钱获取一个客户,然后从中获取收入。模型公司不仅仅花一次钱预训练一个模型,它们会反复这样做。所以真正的问题是,它们能否在发布下一个模型之前收回训练成本(并产生利润)。在我看来,这是最强烈的看空论点,因此值得更深入地探讨。 首先——人们严重低估了模型的商业寿命。有一种看法是,实验室每隔几个月就会发布一个新模型,而旧模型会立即变得一文不值。事实并非如此。Sonnet 3.5作为Anthropic的主力模型已经使用了一年多。GPT-4长期以来一直是OpenAI收入的支柱。而且这些模型不会被“替换”——它们会被分层。新的前沿模型以溢价推出,旧模型则降级服务于高销量、成本敏感的层级。旧模型的收入“转移”的程度远大于“消失”的程度。因此,收回训练成本的时间窗口比看空者想象的要长。 模型世代之间的收入增长显著超过了训练成本增长。是的,训练成本每代增长约3-5倍。但实验室的年收入大致翻倍(或更多),每个新模型都解锁了全新的用例和客户群。换句话说,如果在一个10亿美元的收入基础上,你需要6个月才能收回模型A的训练成本,而模型B的训练成本是模型A的4倍,但你已经在一个30亿美元的收入基础上……那么回报期实际上会缩短。这个比例正在变好,而不是变差。 训练效率本身正在提高。实验室不仅仅是在同一个问题上投入更多的计算资源。更好的数据整理、合成数据、架构改进,所有这些都减少了达到给定能力水平所需的浮点运算次数。因此,如果按单位能力成本而不是原始支出衡量,“每代贵4-5倍”可能被夸大了。 模型寿命比人们想象的要长,收入增长超过训练成本增长,以及训练效率的提高。我很难看到训练回报期变得不可持续。如果说有什么不同的话,那就是数据表明它们正在随着时间的推移变得更好,而不是更糟。 好吧,训练回报成本并不疯狂,但模型公司仍然需要偿还CAC!!我对此的回应是,模型实验室将拥有结构性较低的CAC回报期,因为它们的市场更像是一个寡头垄断,而不是一个超级拥挤的SaaS市场。这可能是我分析中最受质疑的部分……过去有更多的大型实验室竞争者。尘埃落定后,真正突出的只有三家(它们本身就在销售推理token)。OpenAI、Anthropic和谷歌的Gemini。我认为实验室的CAC回报期将更像超大规模云服务商的CAC回报期,因为它们都像寡头垄断。随着时间的推移,新实验室将成为真正的挑战者。但我认为新实验室不会结构性地改变大型实验室的回报期。 对寡头垄断框架的明显反驳是开源。Llama、DeepSeek、Mistral。这些模型很好,而且越来越好,它们基本上是免费的。它们难道不会结构性地限制实验室的定价权吗?我不这么认为,原因有几个。开源模型非常适合实验和“足够好”的用例。但企业客户绝大多数都想要一个供应商,他们想要SLA,他们想要支持,他们想要在出现问题时可以联系的人,他们想要合规认证,他们想要一个不需要自己构建的路线图。大规模运行和提供开源模型并非免费。你仍然需要基础设施、运营团队、微调管道,所有这些。等你构建完所有这些,你基本上已经重建了一个比实验室现有产品更糟糕的版本。开源让实验室在定价上保持诚实(这是一件好事),但我不认为它从根本上打破了盈利能力论点。实验室需要“担心”的是。我确实看到一种模式,公司会使用实验室模型进行快速原型开发,然后寻找一个开源(更便宜)的模型进行大规模部署。这可能是我的论点中的一个预警信号。 最后,“实验室永远不会盈利”的人认为切换成本为零,留存率会波动,最终模型会通过提供相同的功能而商品化。首先(先说清楚),人们对超大规模云服务商(AWS、Azure、GCP)一直这么说……你猜怎么着,尽管它们一路大幅降价,但它们都利润丰厚。我几年前在这里写过这篇文章。超大规模云服务商增加了一个结构性的锁定层,这是实验室没有的——出口费用!尽管没有这个工具,但我认为实验室的切换成本正在以比人们意识到的更快的速度建立起来,并且在几年内会比看空者想象的要高得多。 想想今天实验室的严肃企业部署实际上是什么样子。你拥有基于专有数据进行微调的模型,这些模型无法转移到其他提供商。你拥有围绕特定模型行为和怪癖构建的评估套件。你的工程团队已经围绕特定的API、特定的提示模式、特定的工具使用约定建立了肌肉记忆。你已经迭代了数月的系统提示。你可能已经签订了有议价定价的承诺支出合同。而且,越来越多的功能,如内存、上下文窗口和代理工具生态系统,都是深度提供商特定的。所有这些都无法干净地移植。 而且它只会变得更具粘性。随着实验室进一步进入平台领域——托管代理、管理长期工作流、存储持久上下文、提供微调和检索基础设施——切换看起来不再像是“更换API密钥”,而更像是“从云提供商迁移”。这是一个非常不同的对话。模型本身可能正在商品化(老实说,对于许多用例来说,前沿模型是相当可互换的)。但模型周围的平台并非如此。而这正是留存率建立的地方。

自主性已来:现在,智能体也能做事了 AI
Mar 16, 2026

自主性已来:现在,智能体也能做事了

作者:Parul Singh, Board Partner @ Initialized 机器人 几天前,我看着一个微小的 GitHub 仓库让我大脑中熟悉的一部分安静了下来。 Karpathy 的新项目 autoresearch 大约有 630 行 Python 代码。它在单个 GPU 上运行。你无需接触训练代码;你只需编写一个名为 program.md 的 Markdown 文件来描述研究目标。然后,一个 AI 智能体编辑 train.py,运行 5 分钟的实验,并只保留那些能够改善指标的更改。在你睡觉的时候,它会运行大约一百个实验,将一个小语言模型在单个显卡上向 GPT-2 更近一步。 从理论上讲,这听起来并不新奇。十多年来,我们已经拥有了 AutoML、超参数调整以及“让我们彻底进行网格搜索”等技术。但是,看着这个特殊的循环——人类编写研究计划,智能体编写和重写代码,GPU 在角落里嗡嗡作响——感觉却有所不同。 这感觉就像雇佣了你创业公司的第一位优秀员工。 你给他们一个目标、几个系统的钥匙和一些限制。他们稍后会带着一个更好的世界版本回来。他们做出你没有指定的决定,进行你不会排队的实验,并呈现出你几乎没有时间阅读的结果。 这就是自主性的感觉,当你第一次近距离看到它时。你将一个智能体指向一个问题,给予它访问权限和一个指标,然后它就开始做事了。一旦你体验到这一点,就很难想象回到一个除非有人推动否则一切都一动不动的世界。 在过去的几年里,创业文化重新发现了能动性的真理:你可以直接去做事。不需要许可单,不需要委员会,只需要一个人注意到某些东西坏了并修复它。我们把这句话当作赞美能动性的口头禅告诉创始人和早期员工。 autoresearch 令人感到疯狂的是,能动性不再是人类独有的特质。你友好的邻里自主智能体也可以自己做事。你给它们一个问题、一些钥匙和一个明确的指标,它们就会在你在做其他事情的时候,悄悄地进入技术栈,让现实变得稍微好一点。 autoresearch 是一个清晰的例证:“工作”不是“变得聪明”,而是“在这个沙箱内,利用这些数据,在不破坏任何东西的情况下,尽可能快地改善这个指标。”你编写研究目标,智能体编辑代码并运行实验。这与你与一位优秀的第一位员工的关系相同:你定义竞技场和标准,他们决定如何在其中行动。他们只是去做事。 在操作上,这提出了一种新的工作设计: 对于增长:“在这个实验文件夹和分析堆栈中,持续运行入职和定价测试,以最大化 LTV/CAC,并记录每一次更改。” 对于产品:“在这个功能标志系统中,持续进行 A/B 测试文案和流程,以最小化注册第二步的流失率。” 对于机器学习:“在这个训练脚本和数据集中,搜索架构和超参数以改善验证损失,并且只提交那些达到标准的更改。” 如果你能为一个精力充沛、多才多艺的人类描述这个角色,那么你离为自主循环描述它也就不远了。创始人的工作从“做这件事”转变为“指定工作并构建智能体可以安全地完成它的沙箱。” 第二个转变则更令人不安:优化不再是稀缺资源。 从历史上看,你需要一个数据科学团队、机器学习基础设施和真正的预算来完成这类工作。建立管道、训练循环、日志记录、仪表板——这就是全部。现在,一个工程师可以将一个小代码库指向一个 GPU,加上一个像 autoresearch 这样的智能体循环,就能获得过去需要一个团队才能达到的探索水平。 […]

人工智能时代新的白领护城河 AI
Mar 16, 2026

人工智能时代新的白领护城河

作者:Rob May Anthropic AI Exposure Index Anthropic 的人工智能暴露指数(AI Exposure Index)展示了主要职业领域中理论上的人工智能能力(蓝色)与观察到的现实世界采用情况(红色)之间的差距。在计算机与数学领域,理论暴露度达到94%,而实际覆盖率仅为33%。在法律领域,这一差距从80%到15%不等。蓝色条形代表已经计入价格的结构性革命。红色条形显示了仍在酝酿中的颠覆程度。资料来源:Anthropic,“人工智能的劳动力市场影响:一种新的衡量标准和早期证据”,2026年3月。 在Anthropic最新的劳动力市场影响报告中,最重要的数字并非程序员自动化的头条数据,而是那个差距。几乎在所有知识工作类别中,职业对人工智能的理论暴露度都远远超过了当前现实世界中的采用率。法律工作的理论暴露度为80%,而观察到的采用率仅为15%。商业和金融岗位的潜力为85%,而当前覆盖率为20%。已经体现在招聘统计数据中的颠覆,实际上还不到人工智能可行能力的四分之一被部署的结果。 二阶效应将引导我们投资于建立防御能力。 周日快乐,欢迎来到“投资人工智能”!请务必收听我们的“纽约人工智能播客”,如果您对人工智能活动感兴趣,请订阅我们的“纽约时事通讯”。如果您是开发者,也请查看Neurometric推出的新Claude技能,它可以帮助您为您正在构建的任何任务选择合适的模型。此外,我们现在还提供此时事通讯的付费版本,其中包括从人工智能角度对特定股票的每周分析。因此,请考虑订阅。 今天,我想就一个许多人关心的话题谈谈我的看法——白领工作会发生什么。 在过去几年里,人工智能领域的主流叙事一直是令人安心的:人工智能只是一个更好的工具。一个更快的搜索引擎。一个更智能的自动补全。一个还能写邮件的拼写检查器。这种框架之所以让人感到舒适,是因为它保留了现有的职业生活等级制度——人类在顶端,工具在底层,以及数十年来安全的介于两者之间的制度结构。但到了2026年初,这个神话已经破灭。二阶效应不再是理论上的。中层管理正在被掏空。入门级招聘正在减速。培养了上个世纪每一位高级合伙人、董事总经理和总工程师的学徒模式正在悄然瓦解。我们不仅仅是采用了一个新工具,我们已经进入了一个新环境——而白领经济在另一端将不再是原来的样子。 职业学徒制的崩溃 传统的职业发展模式,其核心是一个结构化的磨砺体系。初级分析师通宵达旦地建立金融模型。律师助理在接触任何重要事务之前,要起草三年的样板合同。入门级工程师最初的十八个月都在修复他们没有写的错误。这些工作通常很乏味,但它也塑造了人。它建立了模式识别能力、判断力和职业直觉,这些都使高级人才变得有价值。 而现在,人工智能以极低的成本将这些“脏活累活”自动化了。曾经需要一个初级分析师团队进行的研究,现在一个AI代理在几分钟内就能完成。样板法律文书起草、数据录入、代码脚手架:这些定义了职业生涯早期的任务,正在从人类的工作描述中消失。 其二阶效应是“资历差距”(Seniority Gap),这个行业才刚刚开始意识到这个问题。如果没有入门级任务,就没有入门级人才的输送渠道。2024年的初级助理到2026年将成为濒危物种——而2036年的高级合伙人本应是这位助理。职业阶梯不仅正在被颠覆,它正在从底部被压缩,使得整整一代未来的领导者没有途径来发展人工智能仍然无法复制的高风险判断力。 “脆弱层”:中层管理的身份危机 中层管理的价值主张建立在信息流之上。数据从一线传来,经过一层管理者的翻译、综合和包装,然后以可操作的形式到达执行层。这个过程——称之为人肉聚合——为庞大的公司组织结构图提供了存在的理由。 而现在,AI代理可以实时执行这一功能。仪表板自动填充。上下文系统(Systems of Context)将洞察直接传递给决策者,无需人工中介。那些花一周时间为周五报告综合团队更新的经理,正在与一个持续、准确且边际成本几乎为零的系统竞争。 一些人恰如其分地称之为“经济中最脆弱的一层”正在崩溃,并非因为中层管理者无能,而是因为他们的核心功能——信息传递——已经被自动化了。在这场转型中幸存下来的管理者,并非通过更努力或更快地工作,而是通过从“人员管理者”转变为“工作流架构师”。他们正在构建、审计和改进人工智能系统,而不是在它们之间进行协调。那些无法实现这种转变的人,不是被同事淘汰,而是被基础设施淘汰。 从任务执行到成果编排 这是超级工作者(Superworker)的世界——而且它正在迅速到来。2026年的生产力不再以在办公桌前花费的小时数来衡量,而是以“行动系统”(Systems of Action)来衡量:即单个专业人士可以架构、指导和审计的AI代理数量。这种转变已经颠覆了传统的定价模式。当一个AI系统可以在四秒钟内完成40小时的法律研究时,按小时计费不仅效率低下,而且毫无道理。律师事务所和咨询公司正被迫转向基于价值的定价,为结果而不是时间收费。在这种模式下茁壮成长的专业人士,不是工作时间最长的人,而是拥有最高质量意图的人:即创造性策略、道德判断和模型可以提供信息但无法做出的高风险决策。 多米诺效应:从办公桌到住宅 二阶效应很少停留在起点。白领角色的空心化并不会止于办公室门口。 随着杠杆模式的普及——一个高级专业人士指导十个AI代理,产出相当于过去三十人团队的成果——公司发现他们可以用少得多的员工获得相同的产出。2026年初,亚马逊、Meta以及越来越多企业公司的裁员潮,并非是披着AI外衣的成本削减行动。它们是劳动力重新校准的第一个结构性证据。Anthropic的研究人员警告说,在某些情况下,这可能使最高暴露度职业群体的失业率翻倍,严重程度堪比2007-2009年的大衰退。 这种涟漪效应并不仅限于薪水。几十年来,高收入白领就业的稳定性是美国科技和金融走廊住宅房地产的金融基础。北加州、曼哈顿下城和波士顿128号公路走廊的优质邮政编码区,其价值是建立在稳定六位数薪水将继续流向有资历的知识工作者这一假设之上的。随着收入波动蔓延到这一阶层,“好社区”的抵押贷款支持的确定性开始减弱。一场“白领衰退”不仅影响被取代的专业人士,它还重塑了郊区住房市场、地方税基以及整个都市生态系统的机构信心。 结论:掌握意图 人工智能不是我们使用的工具,而是我们正在进入的环境。第一波浪潮是关于效率——以更快、更便宜、更大规模的方式做同样的事情。而这一波是结构性的。它正在重组职业生活的架构:我们如何培养人才,如何管理组织,如何为专业知识定价,以及最终,我们如何定义专业人士的价值所在。 要在白领经济的巨大结构性变革中生存下来,专业人士不能再继续充当任务的操作员,他们必须成为成果的编排者。问题不再是“我能用AI更快地完成这个吗?”,而是“我能设计一个比竞争对手的系统产生更好结果的系统吗?”未来的工作不是与机器竞争,而是掌握机器背后的意图——即决定机器甚至试图完成什么的战略、价值观和判断。这是唯一剩下的护城河。而且它比任何头衔或证书所能提供的都更具防御性。

AI
Mar 16, 2026

Agent Skills 是食谱,垂直代理是蛋糕

作者:Kenneth Auchenberg, Partner @ AlleyCorp 目前关于代理技能有很多炒作。Vercel 发布了用于代理技能的包管理器 skills.sh,Anthropic、OpenAI 和 Google 都在将技能管理直接内置到他们的产品中。进展很快,这让我想起了 NPM 的早期阶段。 放眼未来,很容易想象代理技能的市场。你创建一个技能,上传它,标上 5 美元或 10 美元的价格。想象一下面向 AI 的 Lightroom 预设或 Canva 模板。当然,我认为那里有市场。有人会通过把他们的知识打包成其他人可以放入其代理的 markdown 文件来赚不少钱。 但我一直在想的是: 出售技能就像出售食谱,而你想做的是蛋糕生意。 想想当你编写一个技能文件时到底在做什么。你把让你成为出色工程师、文案或分析师的东西——多年的品味、判断力、模式识别——压缩成一个别人可以运行的 Markdown 文件。 这对他们确实有用,毫无疑问。但它把“你”商品化了。 人们真正想要的是出色的写作、整洁的书稿或一份完整的报告。他们想要的是结果,而不是操作说明。 真正的生意是做蛋糕的生意 我最近写过一篇关于杠杆和功能型代理作为思考代理的框架的文章,这与此直接对应。技能市场是一种杠杆玩法。你把一个能提高别人生产力的工具交给他们。 但垂直代理呢?那是功能玩法。它把那些相同的技能与专有数据、强化学习循环和计算能力结合起来,去完成实际的工作 。 我说的是每晚对账并结账的簿记员。那种能够在无人参与下起草、修改并撰写内容的文案代理。那位在凌晨3点为你准备投资备忘录、因为它永不休眠的金融分析师。 那里才是真正的赚钱之处。当你出售 Agent Skills(代理技能)时,你是在指令层面获得报酬,只占成果价值的一小部分。垂直代理则捕获了整个事物的价值。 别卖食谱,卖蛋糕。🧁