大模型内核

深入洞察市场脉搏,精选高价值分析报告

生成式 AI 的 PLG 文艺复兴 大模型内核
Sep 22, 2025

生成式 AI 的 PLG 文艺复兴

本文信息来源:selinasstack 生成式 AI 的赢家先通过 PLG 落地,然后依靠持久的护城河实现复利增长。 引言 我最近看到一组令人震惊的数据: 在一次近期的炉边谈话中,OpenAI 分享了 ChatGPT 已达到 7 亿月活跃用户(WAUs),并拥有约 400 万企业席位。 Anthropic 的首席财务官 Krishna Rao 分享称,Claude Code 的年度经常性收入(ARR)已达到 5 亿美元。这款产品是在 2025 年 5 月正式发布(GA)的。 在另一场活动中,OpenEvidence 分享了他们在推出仅两年后,就已经覆盖了近 50% 的美国医生。这在医疗行业是前所未有的速度。 在生成式 AI 领域仍有许多值得讨论的地方,但有一点是明确的: 生成式 AI 正在推动以产品驱动增长(PLG)的复兴 。本文将解析为什么生成式 AI 能够开启自下而上的全新时代,以及原生 PLG 公司未来可能的发展方向。 背景:为什么 SaaS PLG 停滞不前 在这里,我将 PLG 定义为一种企业 GTM 策略,其中产品本身是客户采用的主要驱动力,而不是市场营销或销售。想想 Dropbox —— 你收到同事的邀请,去查看他们保存在 Dropbox 上的一个文件。访问这个文件的过程是你体验过的最简单的。你非常喜欢它,于是也开始在上面保存和分享文件。某个时刻,你的整个公司都在使用 […]

Nest 已死,Google Home 万岁 大模型内核
Sep 20, 2025

Nest 已死,Google Home 万岁

在 Nest 被拆分后,Google 全新的 AI 驱动 Google Home 能否赢回用户? 本周,Google 宣布已终于完成将其 Nest 品牌智能家居设备中“最优秀”的部分从 Nest 应用迁移到 Google Home 应用。这意味着 Google Nest 硬件用户不必再在两个应用之间来回切换,并且可以终于删除 Nest 应用 。(这里的“最优秀”一词承担了很大的含义,而且部分功能仍处于 Google 的 Public Preview 公测计划中。) 全球最大科技公司之一花了三年多时间才将少数设备迁移到新应用中,这实在令人震惊。再加上 Nest 硬件缓慢而痛苦的衰落,你可能会以为 Google 已经放弃了智能家居。但随着 Google 预告将在 10 月 1 日发布融合 Gemini 技术的 Google Home 硬件重大公告 ,似乎有新动作即将到来。问题是:这会不会为时已晚? 过去五年,对于那些坚持使用 Google Home 生态系统和 Nest 硬件的用户来说,可谓是充满挑战。从停产的产品 、 订阅价格上涨 ,到功能被移除以及 Google Assistant 在 Nest 智能音箱上的性能下降 ,几乎没有什么值得高兴的事,这一点在 Reddit 上的 […]

AI 原生办公套件——人工智能能为你工作吗? 大模型内核
Sep 17, 2025

AI 原生办公套件——人工智能能为你工作吗?

本文信息来源:a16z 人工智能不再只是一个功能——它正在成为你的工作伙伴!从撰写电子邮件到设计幻灯片、进行市场调研,甚至构建财务模型,一种全新的“智能代理”工具层正在兴起,形态类似于原生 AI 办公套件。 但挑战在于:目前市场格局依然分散,每周都有新工具涌现。就在本周,Anthropic 刚刚为 Claude 推出了“ 创建和编辑文件 ”功能!消费者不禁要问:我到底该用哪款工具?在什么场景下我可以开始将智能代理工具融入日常工作? 为了了解这些工具在实际中的表现,我们绘制了市场图谱,并针对各种日常办公任务——制作电子表格、记录会议纪要、撰写电子邮件——对原生 AI 工具进行了基准测试。我们的测试发现,多款通用型工具表现出色,一些垂直领域应用尤为突出,同时也透露出市场发展的一些趋势。 通往智能生产力的两条路径:通才 vs. 专才 市场正在分化为两种智能生产力路径。一种是“全能型”横向工具,旨在跨应用和任务处理各种事务。另一种是纵向专才型工具,专注于深入优化单一工作流程,如电子邮件、演示文稿或电子表格。两者都在快速发展——并且各有取舍。 通才——横向工具 通才型工具注重灵活性 。它们能够在不同的情境、应用和任务之间切换,但往往以牺牲精细度和精准度为代价。在这一阵营中,有三种形式尤为突出: 通用助理: 横向型网络工具,通常具备多模态、基于提示,有时还具备记忆功能,可执行多种类型的任务。 示例:Operator、Manus、Genspark。 自主浏览器: 可在网络上自主浏览并执行任务。一些工具(如 Comet)增加了更高级的功能,例如通过关键词触发时可重放工作流程的快捷方式。 示例:Dia、Perplexity Comet、Browserbase。 浏览器扩展: 叠加在现有工作流程和界面之上的轻量级辅助工具。 示例:MaxAI、Merlin、Monica。 专业工具 – 垂直领域工具 专业工具注重深度和可靠性 。这些工具并不试图包揽一切,而是专注于在信任度、精细度和用户控制至关重要的结构化工作流程中发挥作用。当今的垂直领域格局由覆盖核心专业工作流程的工具所支撑。 邮件助理: 可撰写结构化回复、管理收件箱优先级并处理日程安排任务的助理工具。 示例:Fyxer、Serif、Jace。 演示工具: 由人工智能驱动的工具,可快速创建注重视觉设计、速度和可编辑性的幻灯片。 示例:Gamma、Chronicle、Beautiful.ai。 笔记与文档工具: 用于结构化写作、笔记记录、知识捕捉和协作编辑的工具。 示例:Mem、Notion、Granola。 电子表格工具: 处理数据提取、格式化和分析的应用程序。它们可以向研究或工作流程方向延伸。 示例:Paradigm、Shortcut、Meridian、Julius。 基准测试:这些产品真的有效吗? 为了了解这些工具在现实任务中的表现,我们通过基准测试来衡量它们的优势与不足。 测试提示涵盖了六个核心维度:摘要、沟通、文件理解、研究、规划和执行。 提示: 设计一份以视觉为主的 7 页幻灯片,主题为 2025 年 Z 世代互联网行为趋势。 Gamma 是一款垂直化的 AI 驱动演示工具,内置模板和设计功能,可在两分钟内生成一份幻灯片。作为一款完整的演示文稿编辑器,它提供了广泛的后期编辑控制——用户可以调整布局、更换视觉元素和字体、添加图表,并向 AI 提示获取文本或设计建议。 Genspark 和 […]

xAI 的 Colossus 2 —— 全球首个千兆瓦数据中心,独特的强化学习方法论,融资计划 大模型内核
Sep 17, 2025

xAI 的 Colossus 2 —— 全球首个千兆瓦数据中心,独特的强化学习方法论,融资计划

本文信息来源:semianalysis 现场涡轮机、密西西比州扩建、Solaris Energy、xAI 能否负担得起?中东资金、特斯拉、人才流失、API 收入、消费者增长、强化学习环境 关于 xAI 的 Colossus 1 已有大量报道。孟菲斯的建设项目堪称载入史册:这是史上最大规模的 AI 训练集群,从零开始仅用 122 天建成。配备约 20 万块 H100/H200 和约 3 万块 GB200 NVL72,它至今仍是全球最大、完全投入运行且单一一致的集群(不包括多数据中心训练的高手 Google)。 然而,与 OpenAI、Meta 和 Anthropic 正在建设的吉瓦级集群相比,Colossus 1 的约 300 兆瓦显得相形见绌。它们的超大规模云计算合作伙伴乐于利用自身资产负债表,通过砸钱来赢得市场。 xAI 的实力只是昙花一现吗?今天我们将公布一些来自我们过去一年行业领先的数据中心模型的数据,这些数据对客户开放。这正是我们曾在官方宣布前数月就预测到 Oracle 交易的专有数据。 来源:SemiAnalysis 数据中心行业模型 ——注意:数据中心投入运营与 GPU 投入使用之间存在时间差 简短回答:不是 。xAI 依然稳居前沿 AI 竞赛之列,并有望在算力方面再次超越大多数竞争对手。根据我们的估算,到 2025 年第三季度,其单一训练集群的数据中心总容量将超过 Meta Superintelligence 和 Anthropic。该数据中心容量将为 GPU 搬入做好准备,从而再次打造全球最大单一数据中心。xAI 需要为这些 GPU 筹集资金,但他们已从 Nvidia 获得配额,预计明年年初即可全面训练大规模模型。 Elon […]

“向星巴克卖咖啡豆”——人工智能热潮如何可能使人工智能行业的巨头企业落后 大模型内核
Sep 15, 2025

“向星巴克卖咖啡豆”——人工智能热潮如何可能使人工智能行业的巨头企业落后

本文信息来源:techcrunch 基础模型有多重要? 这似乎是个愚蠢的问题,但在我与 AI 初创公司的对话中经常出现。这些公司越来越适应曾被贬称为”GPT 套壳”的业务模式——即在现有 AI 模型(如 ChatGPT)之上构建界面的企业。如今,初创团队专注于为特定任务定制 AI 模型和界面开发,将基础模型视为可按需替换的商品。这种理念在上周的 Boxworks 大会上尤为明显,整个会议似乎完全聚焦于基于 AI 模型开发的用户端软件。 推动这一现象的部分原因是预训练的规模效益正在放缓——即利用海量数据集训练 AI 模型的初始过程,这是基础模型的专属领域。这并不意味着 AI 停止了进步,而是超大规模基础模型的早期红利已触及收益递减点,未来进展的焦点已转向训练后优化和强化学习。若想打造更优秀的 AI 编程工具,相比在预训练上再耗费数十亿美元的服务器时间,专注于微调与界面设计会是更明智的选择。正如 Anthropic 的 Claude Code 所展示的那样,基础模型公司在这些领域同样表现出色——但这种优势已不再如从前那般持久。 简而言之,人工智能的竞争格局正在发生变化,这种变化削弱了大型人工智能实验室的优势。未来的短期前景并非一场争夺全能人工通用智能(AGI)的竞赛,而是涌现出大量分散的业务领域:软件开发、企业数据管理、图像生成等等。除了先发优势之外,构建基础模型是否能在这些业务中带来任何优势尚不明确。更糟糕的是,开源替代方案的丰富意味着,如果在应用层竞争中失利,基础模型可能无法拥有任何定价权。这将使 OpenAI 和 Anthropic 等公司沦为低利润商品业务的后端供应商——正如一位创始人对我所言,“就像向星巴克出售咖啡豆一样。” 很难夸大这对人工智能行业将意味着怎样戏剧性的转变。在当代繁荣时期,人工智能的成功始终与构建基础模型的公司(尤其是 OpenAI、Anthropic 和谷歌)的成功密不可分。看好人工智能就意味着相信其变革性影响将使这些公司成为划时代的重要企业。我们可以争论哪家公司会脱颖而出,但很明显,某些基础模型公司终将掌握行业命脉。 当时有充分理由认为这种观点成立。多年来,基础模型开发曾是人工智能领域的唯一业务——快速的进步速度使其领先优势看似不可逾越。而硅谷历来对平台优势有着根深蒂固的偏爱。人们普遍认为,无论人工智能模型最终通过何种方式盈利,最大利益都会回流至基础模型公司,因为它们完成了最难复制的核心工作。 过去一年让这一局面变得更加复杂。虽然第三方 AI 服务百花齐放,但它们往往可以随意切换基础模型。对初创企业而言,他们的产品究竟是基于 GPT-5、Claude 还是 Gemini 已不再重要,他们甚至期待能在产品发布中途更换模型而不被终端用户察觉差异。基础模型确实在不断进步,但任何一家公司想要保持足以垄断行业的巨大优势,现在看来都已不太现实。 我们已有诸多迹象表明先发优势并不显著。正如风投机构 a16z 的 Martin Casado 在近期播客中指出的,OpenAI 曾是首个发布编程模型及图像/视频生成模型的实验室——却在三个领域全数被竞争者超越。”就我们观察,人工智能技术栈中并不存在天然护城河,”Casado 总结道。 当然,我们不应过早否定基础模型公司。它们仍拥有诸多持久优势,包括品牌认知度、基础设施和难以想象的庞大现金储备。OpenAI 的消费者业务可能比其编程业务更难复制,随着行业成熟还可能涌现其他优势。鉴于 AI 发展的迅猛速度,当前对训练后技术的热衷很可能在未来六个月内逆转。最大的变数在于,通用智能竞赛可能通过制药或材料科学的新突破获得回报,彻底改变我们对 […]

大模型内核
Sep 08, 2025

进入人工智能的 DOS 时代

本文信息来源:nikunjk 为何我上周在终端里泡了12小时 上周在 Claude Code 里泡了十二小时。黑屏闪烁的光标。我的风投朋友看了一眼就合上笔记本。他们不懂这种快乐。 上周我的 Wi-Fi 快断气了。Mac 信号栏显示满格。经典故障。直接让 Claude Code 查查到底哪出了问题。 没错,我在网络硬件公司 Meter 干过。所有命令行都门清。但看着 CC 瞬间揪出 12 个挤在 6 频道的网络?那些干扰模式、信噪比数据,弹出来速度比我敲第一个命令还快?完全是另一种体验。把路由器切到 11 频道。搞定。 这跟懂不懂命令无关。而是根本不需要用命令。 同一场会议,此刻我正在制作:通宵成功活动的海报(设计元素直接从我网站提取,包括 Monotype 字体),投资备忘录模板,以及 Excel 根本无力处理的电子表格分析。 输入的命令行?零。只需描述需求,然后看着十二小时凭空消失。 Cursor 的预设是:你想写代码。Replit?你想部署项目。但 Claude Code 的起点截然不同。它假设你遇到了问题。没错,终端界面看起来很技术化,确实如此。但当你只需解释问题,而无需理解解决方案时,一切就不同了。 云端智能与完全本地访问的结合。你的机器、GitHub、数据库、系统内部。一次对话触及终端可及的所有领域。意图直接转化为执行。在你和想要构建的东西之间,不再隔着层层应用。 仿佛回到了1985年。 还记得 DOS 系统吗?没人喜欢它。那界面充满敌意,要求你记住所有命令。但 Lotus 1-2-3 电子表格就在那里运行,WordPerfect 文字处理器也是。每个突破性应用,无一例外,都诞生于那个丑陋的终端界面,直到 Windows 让一切变得美观。未来总是先以技术面孔示人。 历史正在重演。当人们还在等待友好版本时,我们已在终端环境中构建未来。虽然不再需要输入命令。我们正通过跨系统执行的对话来实现这一切。 Conductor、Terragon 和 Magnet 深谙此道。他们正在打造超越聊天的交互界面 ——既保留终端强大功能又隐藏黑屏的可视化层级。不出十八个月,我们现在使用的工具都将披上拖拽操作的外衣。 MCP 让一切变得诡异。模型上下文协议使原本互不相通的系统能够互相接话。谷歌云端硬盘的指令流入终端命令行。本地文件与云数据库相遇。这让你意识到,每个正在使用的应用都只是真实可能性的管窥之见。 但此刻,在这个终端阶段,我们正在学习 AI 究竟如何创造。没有应用程序过滤意图。没有产品经理的假设。与智能体进行赤裸对话。 真正的瓶颈不再是技术知识。而是想象力。上周我花了二十分钟描述一个动画效果。不是因为 […]

千亿级角逐:医疗 AI 的市场霸主之争 大模型内核
Sep 02, 2025

千亿级角逐:医疗 AI 的市场霸主之争

本文信息来源:flarecapitalpartners 作者: 帕斯·德赛 目录 引言 看涨买入: 医疗行业 AI 应用加速率 赢家通吃市场: 投资者转向选择性价值集中 制胜法则: 领先医疗 AI 企业的关键特质 波涛汹涌的前路: 龙头企业面临的威胁与机遇 结论 AI 买家与构建者的战略要务 引言 自去年我们发表关于医疗保健行业加速采用人工智能(AI)的观点以来,形势已发生巨变。模型架构和训练技术的突破性进展显著提升了 AI 性能,同时降低了计算力和数据需求。与此同时,专用 AI 硬件、托管云服务和开源模型中心的普及使技术获取民主化,推动生成式 AI 和智能体系统在各行业快速部署。因此毫不意外的是,随着模型性能与用户价值呈指数级提升,而推理成本却直线下降,AI 使用率和采用率正呈爆发式增长 。简而言之,AI 正成为我们个人生活和职业发展中不可或缺的组成部分。 这对医疗行业的未来工作形态具有深远影响,人工智能正作为劳动力均衡器、扩展器和增强器发挥着关键作用。迄今为止的成果显著且切实可见 ,这加速了技术应用的步伐。值得注意的是, 三分之二的医师表示正在使用医疗 AI 产品,使用量同比增长达 78%。这种采用速度令人瞩目,特别是与过去十年间电子健康档案(EHR)的采用速度相比。本轮技术应用周期由产品主导的”拉力”驱动,这与以往许多技术应用周期中”推力”主导的模式形成鲜明对比。 因此,医疗企业领导者如今将人工智能视为远超运营效率提升工具的存在。事实上,企业人工智能战略正受到人才招聘与留存优先级的深刻影响。作为回应,医疗行业领导者普遍增加了人工智能预算投入,重点聚焦于临床医生和患者存在需求、且已证实投资回报率的几类特定解决方案,以此合理化预算扩张。外部合作也展现出比内部自主开发更高的成功率 ,这为新兴人工智能解决方案创造了强劲的顺风效应。 这吸引了众多新兴人工智能公司涌入各个细分领域。就在一年前,各领域的头部 AI 企业融资还只是为了抢占市场份额,如今许多公司正试图通过横向扩张和跨越领域边界来脱颖而出。与此同时,现有企业正通过宣传自身新兴的 AI 能力来巩固护城河。而悄然之间,新的初创公司正借助技术前沿来建立自己的领先优势。头部企业的战略布局将如何重塑行业边界,将决定未来几年医疗 AI 的发展格局。 本项分析中我们将: 通过市场信号研判医疗 AI 应用周期所处阶段 剖析融资数据以理解 AI 在医疗领域创造持久价值的核心区域 分享我们对为何当前医疗保健某些领域比其他领域更适合由人工智能引领变革的见解 研究领先的人工智能领域和企业,揭示推动其成功的关键因素及可能面临的威胁 为扩大人工智能合作规模的采购方,以及寻求巩固竞争优势的构建者提供建议 看涨买入:医疗保健行业人工智能应用加速普及 医疗保健领域正成为人工智能应用的领跑者,打破了其长期以来作为新技术应用落后者的一贯形象。以下图表源自美国人口普查局 ,并收录于 BOND 资本最新发布的 AI 趋势报告 ,数据显示 2025 年美国主要经济领域中,医疗行业的 AI […]

迷雾判断 8.29.25 – AI 创新者的困境 大模型内核
Sep 02, 2025

迷雾判断 8.29.25 – AI 创新者的困境

本文信息来源:cloudedjudgement (A)创新者的困境 人工智能领域近来热议的话题是利润率。然而,静水深流之下,真正的硬约束仍是算力。顶尖实验室和大型 AI 应用供应商每天都在进行算力配给——他们需要决定多少资源投入研究、训练与满足当前需求,以及哪些产品享有优先权。速率限制不断调整,必须保持高度动态,因为所有企业都面临算力约束。单是这种动态调配算力的能力,已开始成为竞争优势…… 这种配给机制会产生二阶效应。赢家将筑起高墙。若某产品真正获得市场青睐,仅维持低延迟和高可靠性就会吞噬大量可用算力(毕竟最终你必然要守护这个真正成功的应用)。想想 OpenAI 的 ChatGPT 或 Anthropic 的代码生成服务——它们各自都有理由长期占据巨大而稳定的算力份额,而算力蛋糕并非无限。其结果就是:企业虽志在多方探索,实则不断优化着现有成熟引擎。 一个熟悉的困境(创新者困境)正以全新方式显现。当新的增长方向出现时(甚至可能挑战现有行业巨头的核心竞争力),它往往处于早期未经验证阶段却发展迅猛。要追逐这一机遇,企业必须从支撑营收和品牌根基的现金牛业务中抽调算力资源。传统软件时代的制约因素是人力与注意力,而 AI 时代则面临人力、注意力与极度稀缺的硬件资源池三重约束。若行动稍有迟疑(哪怕仅延误数月),就可能彻底错失浪潮。编程智能体的快速崛起正是细分领域瞬间颠覆的典型案例。 这种动态将为初创公司创造机会。它们可以专注打造无需每周参与内部算力预算争夺的产品,优先考虑能效设计,跨供应商调配资源,并接受较小的绝对规模以换取更快行动速度。当行业巨头还在空谈平台战略、等待新机柜上线时,初创公司已能直接交付成果。 大型 AI 公司内部的资源配给现状: 服务与训练与研究:你是优先考虑今天的用户体验,还是押注明天的能力前沿 成熟产品与创新产品:你是保护现有领先者,还是给新事物真正的机会 可靠性与覆盖范围:你是为现有用户降低延迟提升质量,还是敞开大门接纳更多用户但承担性能风险 这些都不是抽象权衡。它们是塑造产品路线的日常排程决策。 为何初创企业能赢?原因一如既往… 你选择一个细分领域,围绕该领域定制模型、提示词和数据。更低的浪费意味着每位用户所需的计算资源更少。 在成长过程中,你可以利用跨云服务商和跨区域的资源差价,并接受不均衡的可用性。而大品牌有着更高的服务等级承诺和更低的灵活性。 当行业巨头还在防守通用产品时,你已在单一领域构建起反馈循环和数据护城河。 第一天就能乘风破浪,因为无需内斗争夺资源配额 前路依然艰难。成本压力犹在,GPU 供应风险未消,还需证明可持续的单位经济效益。但至少不必像掉转货轮那般费力… 这意味着什么?可能引发哪些连锁反应? 旗舰产品持续排队等候或隐性限流 价格或质量层级的变动预示着资源配给 在热门领域出现更多合作与授权 这些都表明资源限制正在产生影响 算力短缺正成为新的组织约束。它迫使大型 AI 公司偏向已验证的方案而推迟新尝试。这正是创新者困境的现代版本。优势将向那些能快速且持续进行资源重分配的团队倾斜,更理想的是完全避开内部资源争夺战。当行业巨头守护现金牛业务时,那些高效运作、专注细分领域且能容忍些许混乱的初创企业将抓住下一波机遇。 季度财报摘要 电动汽车企业估值前十强(基于未来12个月收入倍数) 前10名周股价波动幅度 估值倍数更新 SaaS 企业通常以其收入倍数为估值基础——多数情况下采用未来 12 个月的预期收入。收入倍数是一种简化的估值框架。鉴于大多数软件公司尚未盈利或未产生显著自由现金流,这是整个行业唯一可比的指标。即便采用现金流折现法,也充斥着长期假设。SaaS 的商业模式承诺早期增长将带来成熟期的盈利。下文所示倍数通过企业价值(市值+债务-现金)除以未来 12 个月收入计算得出。 整体数据统计: 整体中位数:5.1倍 前五名中位数:29.9倍 十年期收益率:4.2% 按增长区间划分。在以下区间中,我将高增长定义为预期未来12个月增长率>25%,中增长为15%-25%,低增长为<15% 高增长企业中位数:30.5倍 […]

人工智能研究实验困境 大模型内核
Sep 02, 2025

人工智能研究实验困境

本文信息来源:amplifypartners 如果你正在阅读本文,很可能关注人工智能研究领域。若你关注 AI 研究,或许已目睹过关于通用人工智能发展时间线的争论。当丹尼尔·科科塔科和斯科特·亚历山大警告 AI 代理可能在 2030 年前颠覆政府并毁灭人类时 1,说不定你还为此建造了地下掩体。 多数认为超级智能即将到来的人,都预期会出现”智能爆炸”——即当 AI 能够自动化 AI 研究时,人工智能发展将出现戏剧性加速。具体而言,如果高级推理模型能自主生成并筛选研究构想,再通过代码实现这些构想,这种场景就可能成为现实。  我相信我们很快就能训练 AI 智能体来生成多样化的研究构想,筛选最具潜力的方案进行测试 2,并将这些构想转化为代码实现。但我不认为(仅靠)这些能力能显著加速通用人工智能的研发进程。  要理解其中缘由,我们需要审视当前真正制约 AI 研究的因素。当我询问 AI 研究者”什么让你夜不能寐?”时,答案从”AI 开发生化武器”到”问题数据导致训练发散”不一而足。唉,这两个担忧都确有道理。 从这些对话中可以明确一点:瓶颈并非缺乏创意。研究人员脑海中充斥着各种想法,其中数千个尚未得到验证。随着更多人投身 AI 研究领域,积压的创意只增不减——而且其中很多想法在代码层面实现起来并不困难 3。  算力确实是关键瓶颈;我们只是没有足够的 GPU/TPU 来支持 AI 实验,但许多组织都聚焦于当前/迫在眉睫的数据中心容量危机。  人工智能研究中被忽视的瓶颈在于设计严谨的实验、执行这些实验并分析结果 。  若要加速研究进程,我们需要的不是更多想法或代码。 关键在于更快地开展更优质的实验 4。 那么如何实现?通过与研究人员和工程师的交流,三个核心问题浮出水面:    更优化的实验设计 (包含更严谨的评估方法) 更高效的实验运行方法(检测/调试训练代码问题;端到端管理追踪实验) 更完善的实验分析 (诊断失败原因;从小规模实验推演规模化结果) 当研究人员能够设计出严谨验证假设的实验,在稳定环境中运行,严格评估影响并理解失败原因,还能从小规模试验中推演出普遍规律时,我们将开启加速发展的新阶段。这并非因为实现了 AI 研究的自动化,而是因为我们赋能了成千上万的研究者以更高效率推进工作。第一次智能大爆发或许将属于人类。 这些问题确实非常棘手 5。作为风险投资人兼技术乐观主义者,我相信更好的工具能有所帮助,但仅靠工具无法解决实验设计、执行和分析的难题。许多挑战源于复杂的组织动态和激励机制:领导者必须在竞争优势与开放科学之间权衡取舍;管理者担心严谨的实验会拖慢迭代速度;一线研发人员因追求前沿性能而非可复现性获得嘉奖。在快节奏的市场中,团队往往在模型和软件”勉强够用”时就匆忙发布。随着生成式 AI 市场竞争日益激烈、技术进步速度超出所有人的追踪能力、媒体报道不断煽动炒作与争议,这些压力正不断加剧。  解决这些问题需要研究人员、统计学家、工程师等群体深度协作——其中许多人从未应对过如此艰巨的挑战,也未曾有过合作经验。虽然我能指出在关键问题上运用 AI 魔力的巧妙机会,但真正的工作在于构建正确的文化、激励机制和流程。不过我相信,致力于透明科学和严谨实验的专注研究组织能够取得实质性进展。我们终将攻克这个难题。 ‍ 第一部分:设计更完善的实验方案 当前 AI 研究实验普遍缺乏严谨性 2013 年 DeepMind 研究人员提出的 Q 学习变体模型,可直接通过原始像素学习玩 Atari […]