大模型内核

深入洞察市场脉搏,精选高价值分析报告

大模型内核
Aug 25, 2025

AI 的火箭燃料:为何强化学习正迎来高光时刻

本文信息来源:felicis 对于 AI 平台转型而言,强化学习就是火箭燃料。 过去六个月里,新一代强化学习(RL)技术正蓄势待发。两大鲜明而互补的趋势尤为突出: 超大规模 RL 训练环境与” 强化学习即服务 “(RLaaS)云平台。这些创新将彻底改变 AI 系统的学习适应方式,从静态训练迈向动态持续进化。  当 Mercor 等公司不断突破 RL 驱动 AI 进步的边界时,Kaizen、Mechanize 等平台正致力于让 RL 操作变得像启动虚拟服务器般简单。 鉴于 RL 的重大战略意义,我们有必要了解每项技术的内涵、其蓬勃发展的动因,以及它们为 AI 未来创造的机遇。 ‍ 强化学习的时代:从静态模型到动态学习者 当今大多数 AI 模型都是在海量数据集上训练一次后保持固定。它们能力惊人,但也静态固化 。一旦完成训练,它们很难自主改进或适应新任务。强化学习提供了突破这一限制的路径。在强化学习中,AI 智能体通过与环境互动来学习,尝试不同行动并接收反馈(奖励或惩罚)来优化其行为。  这种试错循环可以产生动态自适应的智能体 ,它们能够持续从经验中学习。其愿景是创造出不仅能复述训练数据,更能通过实验真正掌握实现目标方法的 AI——无论是控制机器人、优化业务流程,还是编写软件功能。 当奖励可验证(正确或错误)时,强化学习最为成功,例如在软件开发和数学领域。对于更复杂的场景,正确性可能更为主观,像 OpenAI GPT-5 这样的团队会使用通用验证器,通过多种来源进行研究,逐步验证正确性,自动检查和评分另一个模型的输出。通用验证器对于将强化学习扩展到正确性更模糊的新用例至关重要。 然而,大规模利用强化学习需要两个条件,而这两个条件直到最近都很稀缺:(1) 丰富、逼真的环境 ,代理可以在其中安全地练习复杂任务;(2) 可访问的基础设施 ,用于运行大规模的强化学习训练,而无需每家公司都拥有昂贵的研究实验室。这就是两种新兴技术的用武之地。让我们深入探讨每一种。 ‍ 强化学习环境:AI 的虚拟工作与游乐场 强化学习环境是一个模拟世界或场景,人工智能体可以在其中行动和学习。经典案例包括电子游戏或机器人模拟器,但最新趋势是构建模拟现实工作任务的环境。这些环境可能模拟使用计算机、编写代码、填写表格、回复邮件等人类在知识工作中执行的多步骤任务。通过在如此逼真的模拟中训练,强化学习智能体能够掌握可用于实际工作自动化的技能。 这类似于 GPT-3 为自然语言处理带来的范式转变:大规模扩展训练数据和环境规模,使最终产生的智能体能够应对广泛挑战。 我们发现多家初创公司正在整合大量真实软件界面(如 Salesforce 或 Excel),并采集完整交互数据,使智能体能在真实企业环境中学习。这个强化学习环境构建者生态正在快速发展,其驱动力来自一个深刻认知:更聪明的智能体需要更丰富的训练场。 另一种方法是,Mechanize 公司提出了他们称之为” 复制训练 “的概念。在这种场景下,AI 智能体会获得某个软件或工作流程的现有实现版本,然后要求其根据规范重新创建它。这使得系统能够对照参考标准自动评估智能体的输出,为学习提供强有力的信号。经过数千次此类复制训练后,模型就能掌握现实世界所需的技能,如注重细节、任务分解和错误恢复——这些能力对于实现有意义工作的自动化至关重要。 强化学习环境平台正逐渐成为训练通用 AI 工作者的基础架构。 ‍ 强化学习即服务:按需为所有人提供 RL […]

自由软件与软件商业模式的未来 大模型内核
Aug 19, 2025

自由软件与软件商业模式的未来

本文信息来源:generativevalue 在 AI 生成代码的时代,如何构建可持续的商业模式? 除了 ChatGPT/Claude 之外,编程一直是 AI 的杀手级应用场景。AI 让软件开发变得更便宜、更容易,而这一趋势将会持续下去。 这一趋势已经被广泛报道,但我觉得人们往往把论点停留在“软件已死”上。我想提出论点的第二部分:“软件已死,软件万岁。” 所以我写这篇文章是为了回答这个问题:哪些商业模式能从这一趋势中获益,以及公司如何构建能够利用 AI 生成软件优势的商业模式? 我将从历史先例开始。 自由软件 1970 年 1 月 1 日:IBM 通过将硬件、软件和服务分开销售,创造了现代软件产业。历史上第一次,一家大型计算公司将软件作为独立产品出售,开创了此后 50 年整个行业所遵循的模式。 20 年前,GE“出售”了早期版本的商业软件。更准确地说,他们将这些软件打包,并“免费”赠送,以便销售他们的数控机床。 它是一种差异化的方式,一种销售话术。“购买我们的硬件,就能免费获得我们的软件和服务。” 软件是免费的,而且它是一种差异化的手段。 随着 Cursor、Claude Code、Lovable 等 AI 编码工具的兴起,我们正进入一个软件商业模式更像 20 世纪 50 年代而非 2010 年代的世界。 我今天论点的简要总结是: 软件的构建成本正在降低,开发也变得越来越容易,而且这种趋势只会持续下去。 因此,技术差异化将更难以创造和维持。 这并不意味着软件没有价值;它非常有价值 ,但客户将不太愿意仅为软件本身付费。 因此,软件开发看起来正日益商品化,这意味着价值需要在其他地方创造。 因此,“自由软件”将会更加普遍,这将需要围绕自由软件构建可持续的商业模式。 这些商业模式包括: 硬件: 使用软件销售硬件(或反之) 垂直整合: 提供垂直整合的硬件和软件 服务: 为工作本身(会计、法律)收费,或提供服务将软件集成到复杂的定制化部署中 平台: 客户会为平台的便利性付费,而不是为单点解决方案的功能付费 支付: 免费提供软件,通过交换手续费收费 软件即广告: 软件本质上变成了“互动内容”。如果涉及网络效应,则可获得(∞)额外加分 基础设施 […]

初创公司如何通过持续反馈取胜 大模型内核
Aug 19, 2025

初创公司如何通过持续反馈取胜

本文信息来源:anneliesgamble 利用强化学习和敏捷迭代主导垂直市场 来源:ChatGPT 初创公司取胜的关键在于其发现未被充分服务的机会的能力,尤其是在大型组织行动缓慢或忽视细微需求的领域。在人工智能领域,这意味着要识别那些能够从深度专业化和持续优化中受益的工作流程。 在这里取胜不仅仅依赖于一次性的训练运行,而是需要设计一个能够在生产环境中持续学习的系统。而这个系统的成败取决于两点: 你选择解决的问题 :选择一个深度优于广度的工作流程。 反馈循环 :你收集、评估并整合性能数据的速度和可靠性。 从正确的问题开始 通过将关注点缩小到特定行业,甚至是单一的工作流程,你可以设计出能够涵盖该垂直领域 100% 相关问题的模型。选择单一的工作流程并不意味着你瞄准的是一个小市场规模。相反,这关乎找到一个在整个行业中共享的狭窄聚焦领域。这就是你的切入点,从这里你可以深入融入客户的运营,并向上或向下扩展。 以货运代理为例,一家初创公司可以从优化时间敏感型货物(如易腐品)的承运商选择入手,模型可根据实时数据(如运输时间、变质风险、港口拥堵情况和成本)动态评估承运商,并通过托运人的反馈不断改进。与将承运商选择视为静态优化问题的通用模型不同,这种高度专业化的方法能够通过减少损失和延误立即创造价值。随着模型收集到专有数据(例如承运商绩效指标、用户修正以及供应链中断信息),它可以扩展到处理路线优化、海关文件以及实时跟踪,最终通过提供一个完全整合、由人工智能驱动、能够每日适应客户需求的解决方案,取代传统的运输管理系统(TMS)。 这些问题过于具体且依赖工作流程,前沿模型若没有大量定制化很难在其中表现出色。这正是你的优势所在: 在客户真正关心的边缘案例中拥有更高的准确率。 与行业特定工具和数据源(例如货运代理的 TMS)实现紧密集成。 通用模型永远不会优先考虑的工作流程逻辑和决策制定。 为此,一个更小、垂直领域专用的模型可以通过深度嵌入行业的日常实际情况来实现更优表现,从而比更大、更通用的系统更快地进行试验和优化。 设计一个持续反馈循环 如果你拥有一个紧密且可靠的反馈收集、评估和执行循环,模型的优势会随着时间的推移而不断累积。目标是将每一次交互都转化为让模型变得更好的数据点。 一个强有力的循环通常包括: 受控发布 :模拟或小规模测试。这可能涉及使用历史数据进行模拟,或在一小部分用户中进行有限部署,以便在不让整个运营暴露于潜在错误的情况下收集初步见解。 记录与标注 :记录每一个动作和结果。这会为分析和再训练创建一个丰富的数据集,确保不会丢失任何有价值的信号。 人工参与审核 :尤其适用于模糊或高影响的案例。这会带来更高的准确性,并提供更好的反馈来优化模型。 再训练节奏 :迈向主动学习,让模型每天或每周更新。这能让 AI 与不断变化的用户需求和现实环境保持一致。 逐步扩展 :配合监控和防护措施。 这个循环转得越快,你的优势就越难被超越。 如果你拥有合适的数据和正确的循环,就可以为任务选择最佳的优化方法:RL 擅长基于偏好和风格的调优,而监督微调通常更适合二元或纠错型工作流。在实践中,两者可以互为补充:先通过微调确保正确性,再用 RL 优化判断力和细微差别。 初创公司可以在某一垂直领域内与客户建立更紧密的联系,从而使这些循环运行得更高效。 培训合适的评估人员 你的反馈循环质量取决于其数据质量。这意味着你的评估者(无论是人类还是 AI)需要具备: 领域专业知识 :他们应当使用与终端用户相同的术语,并理解相同的背景。 清晰且一致的标准 :反馈信号不能含糊不清或相互矛盾。 偏见意识 :避免容易被操纵或具有误导性的奖励模式。这涉及将奖励设计为反映决策质量,而不仅仅是结果。 在专业化的工作流程中,最优秀的评估者往往是曾经的从业者。客户也可以对面向用户的输出进行评估,但向他们暴露模型的内部决策逻辑会带来竞争和感知上的风险。优秀的评估者还能帮助塑造奖励函数,使其反映决策质量,而不仅仅是表面的指标。在货运代理的例子中,如果一个路径规划模型的奖励仅基于最快送达,它可能总是选择高价的加急选项,或绕过成本更低的集散枢纽直接运输。虽然在速度指标上表现出色,但这忽略了服务水平协议(SLA)并不紧急、额外成本超过收益,或托运人为了符合可持续发展目标而更倾向于环保路线的情况。 为什么这在当下很重要 你无法在通用智能方面超越大型 AI 实验室的模型。但你可以在深度、迭代速度以及针对客户的特定性能上击败它们。 前沿模型提供商无法在不做取舍的情况下同时为所有人优化。这就像挤压气球——在某个地方用力以提升某一群体的性能,另一部分就会鼓起,从而让其他人的体验变差。 通过将持续反馈循环嵌入到真实世界的工作流程中,你可以构建出这样的模型: 更适合你的特定使用场景。 在每一次交互中不断改进。 在你的领域中,比前沿模型更小、更便宜、更快速。 最优秀的软件很快将内置反馈机制,超越通用的点赞或点踩按钮,转向更丰富、与上下文相关的信号,并直接融入工作流程中。每一次交互、纠正和使用模式都会成为系统可用的训练数据,从而实现持续改进。 前沿模型功能强大,但往往受制于其规模,更新需要大量资源,并且在部署后通常缺乏动态性。相比之下,定制的、特定领域的模型可以通过紧密的反馈循环不断适应环境,而较小的模型能够实现低成本、频繁的再训练。最终形成的是一个垂直领域专用的系统,它是活的,每天都在进化,以应对客户的特定挑战。它所提供的专业化程度和敏捷性,是更大、更通用的模型无法匹敌的。

如何修复你的上下文 大模型内核
Aug 19, 2025

如何修复你的上下文

本文信息来源:dbreunig 减轻与避免上下文失效 接着我们之前的文章“How Long Contexts Fail”,让我们来看看有哪些方法可以减轻或完全避免这些失效。 但在此之前,让我们简要回顾一下长上下文可能失效的一些方式: 上下文中毒: 当幻觉或其他错误进入上下文,并被反复引用时发生。 上下文干扰: 当上下文变得过长,以至于模型过度关注上下文,而忽视了训练中学到的内容时发生。 上下文混淆: 当上下文中的多余信息被模型利用,从而生成低质量的回应时发生。 上下文冲突: 当你在上下文中积累的新信息和工具与提示中的其他信息发生冲突时。 这里的一切都与信息管理有关。上下文中的所有内容都会影响回复。我们回到了那句老编程格言:“ 垃圾进,垃圾出 。” 幸运的是,有很多方法可以应对上述问题。 上下文管理策略 RAG: 有选择地添加相关信息,以帮助 LLM 生成更好的回复 工具配置: 仅选择与上下文相关的工具定义添加到你的上下文中 上下文隔离: 将上下文隔离在各自专用的线程中 上下文修剪: 从上下文中移除无关或不再需要的信息 上下文摘要: 将累积的上下文提炼成精简的摘要 上下文卸载: 将信息存储在 LLM 的上下文之外,通常通过一个存储和管理数据的工具来实现 RAG 检索增强生成(RAG)是指有选择地添加相关信息,以帮助 LLM 生成更好的回答。 关于 RAG 已经有大量的讨论,今天我们不会深入探讨,只想说:它依然非常活跃。 每当一个模型提升了上下文窗口的上限,就会引发一场新的“RAG 已死”争论。上一次的重要事件是 Llama 4 Scout 发布,带来了一个一千万 token 的窗口 。在这个规模下,人们真的很容易产生这样的想法:“算了,把所有东西都塞进去”,然后就收工。 但是,正如我们上次所说:如果你把上下文当作一个杂物抽屉来对待,这些杂物就会影响你的回答 。如果你想了解更多,这里有一个看起来很不错的新课程 。 工具装载 工具装载是指只选择与任务相关的工具定义添加到你的上下文中。 “Loadout”一词源自游戏领域,指的是在进入关卡、比赛或回合前,你所选择的特定技能、武器和装备组合。通常,你的装备组合会根据具体情境进行调整——包括角色、关卡、队友的构成以及你自己的技能水平。 在这里,我们借用这个词来描述为特定任务选择最相关工具的过程。 或许选择工具的最简单方法,就是将 RAG 应用于工具描述。这正是甘甜甜和孙启尧所做的,并在他们的论文《RAG MCP》中进行了详细说明。通过将工具描述存储在向量数据库中,他们能够根据输入提示选择最相关的工具。 在为 DeepSeek-v3 提示时,团队发现,当工具数量超过 30 个时,选择合适的工具变得至关重要。超过 30 个后,工具描述开始出现重叠,导致混淆。当工具数量超过 100 […]

计时收费的终结:法律行业 9000 亿美元的 AI 重新定价 大模型内核
Aug 19, 2025

计时收费的终结:法律行业 9000 亿美元的 AI 重新定价

本文信息来源:ethanjamesb 法律行业最后的重大低效正在终结。AI 原生律所将如何大规模以结果为导向的定价取代计时收费。 法律行业是现代经济中最后一个巨大的市场低效领域之一。当其他行业都发现速度和效率能够带来竞争优势时,大型律所却基于相反的洞察建立了一个价值 9000 亿美元的帝国:稀缺性和耗时反而代表质量。他们训练客户将计费小时数等同于交付的价值,从而创造了唯一一个生产力提升会威胁盈利能力的主要行业。 这并非偶然——而是一个精心构建的经济护城河,使法律服务数十年来免受正常市场力量的影响。 但所有垄断最终都要面对清算。当尽职调查、起草或研究的边际成本接近于零时,基于时间的定价将变得站不住脚。其他所有因技术抹去了时间作为主要成本驱动因素的行业——交易、广告、部分咨询——都在一夜之间失去了定价权。法律是最后的顽固堡垒。 人工智能即将终结它。 计时收费的最后防线 传统的9000亿美元法律服务模式依赖于三个基础原则,而人工智能正在从根本上改变这些原则: 价格与投入挂钩 (按工作时间计费,而非按成果交付) 由助理律师杠杆驱动的规模 (初级律师按高级律师的费率计费) 效率是敌人 (工作越快,收入越低) 这种结构之所以能存续数十年,是因为它除了客户之外对所有人都有利。合伙人最大化利润,助理律师获得培训,律所避免了基于结果定价的风险。客户则为这场精心编排的生产力表演买单。 在每个业务领域中,30–60% 的可计费工时(基于助理律师与合伙人可计费工时的估算)用于可重复、基于规则的任务——这正是 AI 能够压缩 50–90% 的工作。一个年收入 15 亿美元、其中 5 亿美元来自 AI 可在几分钟内完成的任务的律所,将面临一个关乎生存的数学难题。即使是保守采用,这也是一条 2.5 亿美元的收入线正面临直接压力。 对于传统律所来说,AI 带来了一个无法抉择的困境: 采用 AI → 工作时长减少 → 收入下降 抵制 AI → 客户流向更快、更便宜的竞争对手 如果不进行定价转型,采用 AI 将引发利用率危机:律师助理过多,而工作量不足。 为什么大型律所无法转型 收入确认冲击 — 固定定价会导致单个案件的收入大幅下降,除非业务量激增——这需要完全不同的销售模式。 合伙人薪酬政治 — 转向固定费用会引发关于如何分配更小蛋糕的争斗。 利用率指标失效 — 砍掉计时制就等于砍掉所有仪表盘、薪酬计划和绩效评估所依赖的关键指标。 定价纪律风险 — 当采购方要求折扣时,效率提升的收益会流向客户,而非律所。 文化阻力 — 按时计费是职业身份的一部分。取消它就像移除了记分板。 真正的顶级律所创新领袖现在正看到这一点:“由于我们的效率极高,费用也非常高,我们将侵蚀我们的减记缓冲。我们需要大幅加强业务拓展,因为我们需要重新部署这些工时,否则最终将不得不考虑固定费用。” —— 顶级 […]

开发者称 GPT-5 好坏参半 大模型内核
Aug 16, 2025

开发者称 GPT-5 好坏参半

本文信息来源:wired 软件工程师发现,OpenAI 的新 GPT-5 模型在帮助他们思考编码问题方面很有用——但在实际编码上的表现并没有好太多。 上周,当 OpenAI 发布 GPT-5 时,它告诉软件工程师,这款模型旨在成为一名“ 真正的编码协作伙伴 ”,擅长生成高质量代码并执行具备自主性的自动化软件任务。虽然公司并未明确说明,但 OpenAI 似乎是在直接瞄准 Anthropic 的 Claude Code,后者已迅速成为许多开发者进行 AI 辅助编程的首选工具。 但开发者告诉 WIRED,GPT-5 目前的表现好坏参半。它在技术推理和规划编码任务方面表现出色,但一些人表示,Anthropic 最新的 Opus 和 Sonnet 推理模型依然能生成更好的代码。根据开发者使用的 GPT-5 版本不同——低、中或高冗长度——该模型可能会更为详尽,而这有时会导致它生成不必要或重复的代码行。 一些软件工程师还批评了 OpenAI 评估 GPT-5 编码性能的方式,认为其使用的基准测试具有误导性。一家研究公司称 OpenAI 发布的一张夸耀 GPT-5 能力的图表是一次“图表犯罪”。 GPT-5 至少在一个方面表现突出:有几个人指出,与竞争对手的模型相比,它的性价比要高得多。“在我们的测试中,GPT-5 大多被其他 AI 模型超越,但它真的很便宜。”普林斯顿大学计算机科学博士生兼研究员、AI Snake Oil 一书的合著者 Sayash Kapoor 说道。 Kapoor 表示,自上周该模型向公众发布以来,他和团队一直在运行基准测试来评估 GPT-5 的能力。他指出,他们团队使用的标准测试——衡量语言模型编写代码以重现 45 篇科学论文结果的能力——在 GPT-5 设置为中等或中等冗长度时,运行成本为 30 美元。而使用 Anthropic 的 Opus […]

GPT-5 为广告变现与超级应用奠定舞台 大模型内核
Aug 15, 2025

GPT-5 为广告变现与超级应用奠定舞台

本文信息来源:semianalysis ChatGPT 将如何对免费用户实现变现、Router 是发布形式、AI 将投放广告、谷歌护城河受侵蚀?、购买意向查询的转移 对许多高级用户(Pro 和 Plus)来说,GPT-5 是一次令人失望的发布。但细看之下,真正的发布面向的是 ChatGPT 的大多数用户,即那超过 7 亿、且增长迅速的免费用户群。高级用户感到失望是可以理解的; 这次发布并非为了他们 。对 OpenAI 来说,真正的消费级机会在于最大的用户群体,让目前在日常生活中很少使用 ChatGPT 的未变现用户间接付费,才是其最大机遇。 那些只关注模型能力的分析师忽视了 ChatGPT 正迅速获得的更大范围的网络效应。2023 年 11 月时,ChatGPT 甚至不在前 100 名的网站之列;而现在它排名第 5,超越了 X/Twitter、Reddit、Whatsapp、Wikipedia,并迅速接近 Instagram、Facebook、YouTube 和 Google。在前十名中,每一个平台都比 ChatGPT.com 存在时间长得多,而未变现用户的数量令人震惊。 但随着 GPT-5,这一切都将改变。OpenAI 正在为变现这一全球最大、增长最快的网络资产之一奠定基础,而这一切都从路由器开始。 路由器就是发布 在 OpenAI 的发布网页上,第二段讲的是“一体化系统”,特别强调了路由器 。措辞具有指导性。 GPT‑5 是一个统一系统,包含一个智能高效、能回答大多数问题的模型,一个用于更困难问题的深度推理模型(GPT‑5 thinking),以及一个实时路由器,能根据对话类型、复杂程度、工具需求和你的明确意图快速决定使用哪一个 (例如,如果你在提示中说“认真思考这个”)。 路由器会持续在真实信号上训练,包括用户切换模型的情况、对回答的偏好率和测得的正确性,并随时间改进 。一旦达到使用上限,每个模型的迷你版本将处理剩余查询。在不久的将来,我们计划将这些能力整合到单一模型中。 路由器在成本和性能两方面发挥多重作用。在成本方面,将用户路由到各模型的迷你版本使 OpenAI 能以更低的成本为用户提供服务。在性能方面,它将使许多用户首次能够使用思维式也就是 CoT(链式思维)推理。超过 99%的免费用户尚未与像 o3 这样的思维模型互动,而对于普通用户来说,ChatGPT 刚刚获得了巨大的升级。暴露于思维模型的免费用户数量在第一天增长了 7 倍,付费用户数量则增长了近 3.5 倍。 来源:OpenAI,SemiAnalysis […]

GPT-5:姗姗来迟、被过度炒作而令人失望,但这还不是最糟的 大模型内核
Aug 11, 2025

GPT-5:姗姗来迟、被过度炒作而令人失望,但这还不是最糟的

本文信息来源:garymarcus 一次发布搞砸了……以及一篇预示麻烦的新研究论文 生成式人工智能度过了真正糟糕的一周。迟到且令人失望的 GPT-5 的发布甚至还不是最糟的部分。但在谈到最糟的部分之前(剧透:我将在文末讨论的一篇新研究论文),先回顾一下 GPT-5 那混乱的首秀。 本该是 OpenAI 最终巩固其主导地位的一周。传闻已久的 GPT-5 即将登场。Sam Altman 在直播首秀前自信得不得了,他发了一张《星球大战》电影《侠盗一号》的截图: 人们买账了。那条帖子获得了将近六百万次观看。 自信的姿态在直播开场时继续延续。Altman,这位天生的表演者,声称 我们认为你会比以往任何 AI 更喜欢使用 GPT-5。它有用、聪明、快速且直观。GPT-3 有点像在和一个高中生对话。 有过闪光的瞬间,也有许多令人恼火的地方,但人们开始使用它并从中获得一些价值。GPT-4o 也许更像是在和一个大学生交谈……而现在的 GPT-5 则像是在和一位专家对话——一位真正的博士级专家,随时可以在任何你需要的领域帮助你实现目标。 主流媒体至今大多还没告诉你的是,几天后,几乎没有人再相信 Altman 的说法。 有 3,000 人对 GPT-5 厌恶到发起请愿——并且成功——要求恢复其中一个旧模型 。在通常相当支持 OpenAI 的 OpenAI reddit 上,置顶帖子是这样的: 正如推特上所说,Altman 那条关于死亡之星的推文并没有经得起时间考验 。 与此同时,至于那部星球大战电影 , 不少人开始怀疑 Altman 是否看过这部片子。不熟悉的人需要知道,接下来发生的事是……反抗军炸毁了死亡之星。 § OpenAI 基本上是自我毁灭了——而且并非好事。除了少数每出新模型就称赞的网红外,主流反应是巨大的失望。 一个能在上线后一周内不被社区发现大量荒谬错误和幻觉的系统,本来会让我真正印象深刻。 相反,仅数小时内,人们就开始发布那些一如既往荒谬的错误 。一条 Hacker News 帖子残酷剖析了伯努利效应的实时、氛围编码演示 。多篇帖子指出了表现不佳的基准测试 。(不仅是我几天前在快评中提到的 ARC-AGI-2)。还有人发现新的自动“路由”机制一团糟 。这基本上和以往每个模型的体验如出一辙。大承诺,愚蠢的错误。 但这一次,反应有所不同。因为期望值被抬到了极高,一个庞大的人群将 GPT 5 […]

人工智能的开放性 大模型内核
Aug 11, 2025

人工智能的开放性

可操作摘要 随着科技界人士不断尝试将人工智能变为现实,机器学习和数据科学作为一项渐进式的进步而日益受到重视。随着摩尔定律的推进和互联网带来“大数据”时代的到来,人工智能能力的加速发展已初具规模。 OpenAI成立于 2015 年,是一家非营利组织,致力于为每个人打造人工智能。随着 OpenAI 研究的不断深入,公司越来越将重点放在通用人工智能 (AGI) 上。 2017 年 3 月,OpenAI 领导层决定,如果公司要真正迈向 AGI,那么公司的非营利性地位已不再可行,因此决定从非营利性公司转变为一家有上限利润的公司。 2018年6月,OpenAI发表了《通过生成式预训练提升语言理解能力》一文,标志着GPT模型的诞生。GPT模型是一种基于Transformer的神经网络架构,专为语言生成任务而设计。 2020年1月,OpenAI研究员、约翰·霍普金斯大学教授Jared Kaplan等人发表了《神经语言模型的缩放定律》。计算和缩放的重要性成为OpenAI模型发展的核心。 对计算的同样渴望促使 OpenAI 最终从微软筹集了数十亿美元,以获得对 Azure 的优先使用权。 OpenAI于 2018 年 4 月发布其章程时,宣称其致力于避免“权力过度集中”的工作。然而,在脱离非营利组织身份并与微软达成协议后,人工智能社区成员对 OpenAI 日益封闭的立场表示担忧。 OpenAI 从开源转向更加封闭的理念,导致了开源支持者与 OpenAI 支持者之间的理念分歧。同样的冲突也导致一些团体脱离 OpenAI,试图变得更加开放。 最引人注目的是,OpenAI 前研究副总裁Dario Amodei离职创办了自己的公司 Anthropic。在此过程中,他带走了14 名研究人员,其中包括OpenAI 前政策负责人 Jack Clark。尽管 Amodei 于 2020 年 12 月离开 OpenAI,但据报道, “此次分裂源于 [OpenAI] 在 2019 年获得微软10 亿美元里程碑式投资后,对发展方向的分歧。” […]