大模型内核

深入洞察市场脉搏,精选高价值分析报告

2025 LLM 年度回顾 大模型内核
Dec 21, 2025

2025 LLM 年度回顾

[videopress nYd8ElIc] 本文信息来源:bearblog.dev 2025 年是 LLMs 取得重大且充满事件性进展的一年。以下是一份我个人认为值得注意且略感意外的“范式转变”清单——这些变化改变了整体格局,并在概念层面给我留下了深刻印象。 1. 来自可验证奖励的强化学习(RLVR) 在 2025 年初,所有实验室中的 LLM 生产技术栈大致如下: 预训练(约 2020 年的 GPT-2/3) 监督微调(InstructGPT,约 2022 年)以及 来自人类反馈的强化学习(RLHF ~2022) 这曾在一段时间内是训练生产级 LLM 的稳定且经过验证的食谱。到 2025 年,来自可验证奖励的强化学习(RLVR)成为加入这一组合中的事实上的新主要阶段。通过在多个环境中(例如数学/代码谜题)针对可自动验证的奖励来训练 LLM,LLMs 会自发地发展出在人类看来像是在“推理”的策略——它们学会将问题解决分解为中间计算,并学习多种来回推敲以弄清问题的解题策略(示例可参考 DeepSeek R1 paper)。在以往的范式中,这些策略很难实现,因为并不清楚对于 LLM 而言最优的推理轨迹和恢复方式应当是什么样子——它必须通过针对奖励进行优化,自己找到对其有效的方法。 与 SFT 和 RLHF 阶段不同,后者都是相对较薄/较短的阶段(在计算上只是轻量的微调),RLVR 涉及针对客观(不可被博弈化)的奖励函数进行训练,这使得可以进行更长时间的优化。实践表明,运行 RLVR 具有很高的能力/美元性价比,这吞噬了原本计划用于预训练的算力。因此,2025 年的大部分能力进展,都是由 LLM 实验室消化这一新阶段的算力积压所定义的;总体来看,我们看到的是规模大致相近的 LLM,但伴随着更长时间的 RL 训练。这个新阶段还带来了一个独特之处:我们获得了一个全新的旋钮(及其相关的尺度律),可以通过在测试时生成更长的推理轨迹、增加“思考时间”,来将能力作为测试时算力的函数加以控制。OpenAI o1(2024 年末)是第一个展示 RLVR 模型的例子,但 o3 的发布(2025 […]

Gemini 玩《宝可梦》的诞生过程 大模型内核
Dec 21, 2025

Gemini 玩《宝可梦》的诞生过程

[videopress fyjRVx41] 本文信息来源:jcz.dev Google CEO Sundar Pichai 在舞台上庆祝 Gemini 战胜《宝可梦》时,开玩笑地将 “API” 称为 “Artificial Pokémon Intelligence(人工宝可梦智能)”。 大型语言模型能否打败一款已有 29 年历史的电子游戏?这个问题表面上看似简单,但答案却演变成了一场深夜编码、诡异 AI 行为以及大量高关注度曝光交织而成的旋风。当我启动 Gemini Plays Pokémon 项目时,我想看看 Google 最新的 AI 是否能在其他模型曾经受挫的地方取得成功。随之展开的旅程最终迎来了 Google CEO Sundar Pichai 的点名称赞 ,也揭示了这个看似简单的问题背后究竟有多么复杂。 为什么选择《宝可梦》?乍一看,让 AI 打通一款已有 29 年历史的游戏似乎有些无关紧要,但 《宝可梦 蓝》 为 AI 推理能力提供了一个极具吸引力的测试场景。这款游戏要求进行长期规划、战略性决策,以及在开放世界中的空间导航——这些都是迈向更通用人工智能道路上的核心挑战。 从旁观者到创作者 我与这个项目的缘分始于一名充满好奇的旁观者。几个月来,我在 Reddit 和新闻中反复听说 Anthropic 的 Claude Plays Pokémon 实验。然而,当我去观看直播时,很快就发现这个模型在理解 2D、俯视角像素风格游戏方面存在严重不足。Claude 的流程缓慢且经常陷入困惑。观众指出,它很难“看清”2D Game Boy 图像中的关键细节。比如,它的 harness 并未提供哪些树是可以砍伐的信息,迫使它依赖不可靠的视觉输入,结果经常卡住。Claude 也经常把告示牌误认为是建筑入口,甚至有一次,这个可怜的 […]

文案撰稿人揭露 AI 如何摧毁了他们的行业:直到被裁员的那一天,我被迫使用 AI 大模型内核
Dec 15, 2025

文案撰稿人揭露 AI 如何摧毁了他们的行业:直到被裁员的那一天,我被迫使用 AI

[videopress mG2J8Rsq]本文信息来源:bloodinthemachine 文案撰稿人是最早被 AI 公司盯上工作的群体之一。以下是他们在 AI 时代三年后的故事。 早在 2025 年 5 月,在我首次发出征集”AI 杀死了我的工作”故事的呼吁后不久,我收到了来自雅克·勒莱二世的一份深思熟虑的投稿。雅克分享了他作为一家软件公司支持运营主管的故事,在那里,他的工作之一是撰写文案,记录如何使用公司的产品。 “AI 并没有完全扼杀我目前的工作,但这确实意味着我现在的大部分工作是训练 AI 去做一份我以前会训练人类去做的工作,”他告诉我。”它确实扼杀了我过去的工作,而那份工作曾帮助我晋升到现在的职位。”他既为自己担忧,也为他那些更资历尚浅的同行担忧。正如他告诉我的:”我不知道初级开发人员、支持专员或文案撰稿人应该如何成为高级开发人员、支持经理或营销人员,因为晋升所需的经验已经不再可获得了。” 当我们在六个月后再次与雅克联系时,他的公司已经解雇了他。”实际上我是在感恩节前一周被解雇的,因为 AI 已经足够好了,”他写道。 他详细说明道: 聊天机器人进来后,我的工作就变成了管理机器人,而不是管理一个客服团队。一旦这些机器人被充分训练到能够提供”足够好”的支持,我就被淘汰了。我曾以成为最优秀的员工而自豪。公司实际上还获得了 G2(一个软件评测网站)颁发的”最佳支持”奖。我们曾以卓越的服务著称,但我确信现在这些声誉会淹没在大量聊天机器人之中,而这些机器人可能有人审核和调整,也可能没有。 正如本项目和其他地方所记录的那样,今年对许多其他工作者来说同样艰难——从艺术家和插画师看到客户工作量骤降,到翻译人员大规模失业,再到科技工作者看到他们的职位被急于将 AI 注入每个可能流程的管理者颠覆。 因此,我们在”AI 杀死了我的工作”专题中以审视文案写作来结束 2025 年,文案写作是最早被科技公司 、 媒体和文案写作者自己指出特别容易被工作替代的职业之一。早期被 AI 取代的报道之一是那个令人悲伤且难忘的故事 ,讲述了一位文案写作者的资深同事开始在工作聊天中称呼她为 “ChatGPT”,之后她在没有任何解释的情况下被解雇。YouTube 上很快就充斥着网红和骗子向观众承诺使用 AI 文案工具每月能赚数千美元 。 但自那以后,关于这一切如何演变的调查并不多。在这个充斥着廉价 AI 文本生成器、高管圈子陷入 AI 采用狂热的世界里,文案撰稿人的境况如何?一如既往,我们转向工作者本身寻求答案。再一次,他们讲述的故事令人不快。这些是关于部门被裁撤、工作枯竭、失业和企业倒闭的叙述。我听到一些文案撰稿人现在担心失去自己的公寓,有一位转向性工作,还有其他人懊恼地被迫使用 AI。 本系列的读者会发现一些反复出现的主题:客户公司接受的工作在由 AI 制作时并不更好,但它更便宜,并被认为”足够好”。文案撰稿工作并未完全消失,但往往降级为编辑客户生成的 AI 输出的零工。工资和费率正在自由落体式下降,尽管一些人仍抱有希望,认为企业会意识到人性化的触感将帮助他们从 AI 同质化的雪崩中脱颖而出。 至于雅克,他搬到了墨西哥——那里生活成本更低——同时寻找新工作。他并不乐观。正如他所说,”外面的世界越来越黑暗了,伙计。” 他们解雇了所有自由职业者,用 AI 取代了我们 社交媒体文案撰稿人 我相信我是最早被 AI […]

大模型内核
Dec 15, 2025

模型远不如系统重要:大多数人都错过的最重要 AI 理念

本文信息来源:investinginai 祝周日愉快,欢迎来到《投资 AI》。如果你还没有看过我们新推出的《纽约 AI》播客, 请在 Spotify 上收听或在此观看视频版本。我们的最新嘉宾是来自 RealityDefender 的 Ben Colman,这是一家深度伪造检测公司。 在工作任务基准测试中,一个由小型模型组成的系统能够比 GPT-5 高出 15 个百分点。这是一个重大发现,今天我想解释一下我们在 NeuroMetric 所做的一些研究,来展示这一反直觉的结果。 这一切始于 Stephen Wolfram。我见过 Stephen 几次,他同意在我于 2024 年夏末组织的一次会议上发言。炉边谈话的主持人遇到了问题,不得不在最后一刻取消,所以我亲自采访了 Stephen。我的最后一个问题是关于 AI 模型的未来,Stephen 提出了一个我之前真的没怎么听过的观点。他说了大意是” 这些模型很大,包含了大量知识,但对于你正在做的大多数任务,你真的不需要那么多知识。所以未来是更小、更专业化的模型 。” 上周,我们在 NeuroMetric 推出了一个排行榜 ,突出展示了这个反直觉的理念——小型模型组成的系统表现优于前沿模型。我们的发布被 The Deep View 报道 (我强烈推荐的一份通讯),正是因为这个原因——这个结果很新颖。 我们在 CRM-Arena 上进行了研究,这是最能反映真实世界工作任务的公开数据集之一。让我们比较一下模型加思维算法的系统与前沿模型在这项任务上的表现。 这篇研究论文显示 GPT-5 的表现为 58%。相比之下,我们的研究表明,采用”N 选最佳”方法的 GPT-OSS-120b 可以达到 63.8%,而使用 5 个不同模型并针对每项任务选择合适模型的系统成功率为 72.7%。而且成本也低得多(我们很快会发布自己的成本分析。) Wolfram 是对的。但结果比预期的还要好。小型模型运行更快,占用更少内存,因此,模型系统往往能让你获得性能三重优势: 比使用单一前沿模型更快、更便宜、更准确。 这应该是显而易见的,因为前沿实验室正在转向使用路由前端,从几个最适合该工作的模型中进行选择。但是,他们最可能不会做的是从数千个特定任务模型中进行选择,其中包括一些针对特定企业需求的独特模型。 这种向模型系统转变的趋势对企业具有深远的影响。 这意味着他们可以通过结合使用基于自有数据训练的模型和各类公开模型,来保护其核心知识产权和工作流程。并非所有任务都需要依赖前沿模型实验室。 这意味着他们拥有众多调节手段来优化成本、延迟、准确性,甚至模型性能的一致性。 这意味着智能部分转移到了系统层,而不仅仅是模型层。如何调用和探测这些模型(最佳 N 选择 vs 束搜索 vs 思维链等)至关重要。我预计最终我们会看到系统层的嵌入反馈给模型,通过提供更多系统上下文使模型表现更佳。 这并不意味着人们会停止使用前沿模型。只是意味着随着 […]

编写高质量的 CLAUDE.md 大模型内核
Dec 01, 2025

编写高质量的 CLAUDE.md

注意:本文也适用于 AGENTS.md,这是相当于开源版 CLAUDE.md 的文件,主要用于 OpenCode、Zed、Cursor 和 Codex 等 Agent 与工具。 ## 原则:LLMs (极大程度上) 是无状态的 LLMs 是无状态函数。它们的权重在用于推理时已被冻结,因此它们不会随时间推移而学习。模型对你的代码库的了解仅限于你输入的 token。 同样,像 Claude Code 这样的编程智能体工具通常需要你显式地管理智能体的记忆。CLAUDE.md(或 AGENTS.md)是默认情况下唯一会被包含在你与智能体进行的每一次对话中的文件。 这有三个重要的含义: 编程智能体在每次会话开始时,对你的代码库完全一无所知。 每次启动会话时,你都必须把所有关于代码库的重要信息告诉 AI 智能体。 CLAUDE.md 是实现这一点的首选方式。 ## CLAUDE.md 帮助 Claude 快速上手你的代码库 由于 Claude 在每次会话开始时对你的代码库都一无所知,你应该使用 CLAUDE.md 来引导 Claude 熟悉你的项目。概括来说,该文件应该包含以下内容: WHAT(是什么):向 Claude 介绍所用的技术、技术栈以及项目结构。给 Claude 提供一份代码库的地图。这点在单一代码库(monorepos)中尤为重要!告诉 Claude 有哪些应用、哪些是共享包,以及每个部分的作用,这样它就知道该去哪里查找内容。 WHY(为什么):告诉 Claude 该项目的目的以及代码库中各部分都在做什么。项目不同部分的意图和功能分别是什么? HOW(怎么做):告诉 Claude 它应该如何在这个项目上开展工作。例如,你是使用 bun 而不是 node 吗?你需要包含它在该项目上进行实质性工作所需的所有信息。Claude 如何验证它所做的更改?它如何运行测试、类型检查和编译步骤? 但是,你执行此操作的方式很重要!不要试图把你认为 Claude 可能需要运行的每一条命令都塞进你的 CLAUDE.md 文件中——这样效果反而不理想。 ## Claude 经常忽略 CLAUDE.md 无论你使用的是哪种模型,你可能会注意到 Claude 经常忽略你 CLAUDE.md 文件的内容。 […]

ChatGPT for Mac 为什么这么好用? 大模型内核
Dec 01, 2025

ChatGPT for Mac 为什么这么好用?

Claude、Copilot 与如何打造一款优秀的桌面应用。 今年,尽管 Anthropic、Google 和其他公司向 OpenAI 的模型性能冠军宝座发起了挑战,但 ChatGPT 作为一款终端用户产品的领先地位却愈发稳固。在上周的 Dithering 播客 (需付费) 中,Ben Thompson 指出了造成这种局面的一个方面: 我需要有人写一篇盖棺定论的文章,解释为什么 ChatGPT 的 Mac 版应用会如此出色,以及为什么其他公司在开发同类产品时都显得失职。 据报道,Gemini 3 本周即将发布。[…] 我对此充满期待,也相信它会很不错。但正因为 ChatGPT 的 [Mac] 应用如此实用,如果想让我弃用 ChatGPT 转而使用 Gemini 3,后者必须拥有天文数字般的好才行。 模型的实用性取决于其应用。随着 AI 逐渐多模态化并更擅长使用工具,这些界面变得愈发重要——甚至到了模型的应用现在比基准测试更重要的地步。虽然每个主流 LLM 都有这类移动版应用,但只有三个拥有 Mac 版应用:Copilot、Claude 和 ChatGPT。 而在它们之中,只有一个真正称得上优秀。 稍等——正文这就开始。 应用程序 ChatGPT for Mac 是一口出色的应用。它维护得力,运行稳定,性能优越,而且使用体验令人愉悦。在过去的一年半里,OpenAI 几乎总是在第一时间将大多数 ChatGPT 的新功能带到 Mac 客户端,甚至推出了诸如 与应用协作(Work with Apps) 这样的 Mac 独占功能。 […]

大模型内核
Nov 26, 2025

伊利亚·萨茨克维尔——我们正从规模化时代迈向研究时代

本文信息来源:dwarkesh “这些模型在泛化能力上不知何故比人类差得多。这是一个非常根本的问题。” 伊利亚和我讨论了 SSI 的策略、预训练的问题、如何改进人工智能模型的泛化能力,以及如何确保 AGI 顺利发展。 [videopress gnzC1jXN] 在 YouTube 观看;在 Apple Podcasts 或 Spotify 收听。 时间戳 (00:00:00) – 解释模型的不规则性 (00:09:39) – 情感与价值函数 (00:18:49) – 我们在扩展什么? (00:25:13) – 为什么人类比模型拥有更好的泛化能力 (00:35:45) – 直击超级智能 (00:46:47) – SSI 的模型将从部署中学习 (00:55:07) – 对齐 (01:18:13) – “我们正处于一个以研究为核心的时代” (01:29:23) – 自我博弈与多智能体 (01:32:42) – 研究品味 文字记录 00:00:00 – 解释模型的不稳定性 伊利亚·苏茨克维 00:00:00 你知道最疯狂的是什么吗?所有这一切都是真实的。 德瓦尔凯什·帕特尔 00:00:04 什么意思? Ilya Sutskever 00:00:05 你不觉得吗? 所有这些人工智能的东西,所有这些湾区……它正在发生。这难道不是科幻小说里的情节吗? […]

Surf Copilot:首个真正以加密货币思维运作的 AI 大模型内核
Oct 28, 2025

Surf Copilot:首个真正以加密货币思维运作的 AI

本文信息来源:chainofthought 在测试了几十个“加密货币领域的彭博社”之后,我终于找到了一个既懂数据又懂文化的。 我其实已经记不清有多少初创公司自称是“加密货币领域的彭博社”了。 这是一个很有吸引力的提议,因为任何真正做过加密货币研究的人都知道这个过程有多么糟糕。你首先在 DeFiLlama 上查看 DEX 交易量,然后跳转到 X 平台查看情绪,接着浏览 Telegram 和代币经济学仪表盘,并交叉参考半翻译的 Medium 帖子。等你核实完真实信息时,市场已经变了。 即使是 OpenAI 也没有解决这个问题。ChatGPT 可以写出清晰的摘要,但它在加密货币方面却力不从心,因为大多数相关信息分散在实时区块链、私人聊天和不断变化的 API 中。它能读懂文字,却无法理解文字所描述的世界。 这才是真正的瓶颈。信息是丰富的; 解读 是稀缺的。 下一波研究基础设施不会是另一个仪表盘或聊天机器人。它将是直接基于实时、可验证数据进行推理的 AI 系统。 这正是 Surf Copilot 所代表的:AI 原生研究堆栈的早期原型。它读取我们所读取的相同数据(链上流、社交信号、开发者活动),并将其转化为看起来像人工制作且具有上下文意识的报告。这是聚合与理解之间的区别。 我测试过许多这类助手,希望能找到真正能让研究变得更容易的工具。Surf 是少数真正让我印象深刻的工具之一 。 难怪 Pantera、Hashed 和 YZi Labs 等顶级基金都在使用它来获得优势。 Surf Copilot 声称能做什么 Surf 自称是领域原生 AI 研究副驾驶, 它通过实时的链上、社交和技术数据进行训练。 它由 Cyber(前身为 CyberConnect) 构建,其社交数据层已为多个 Web3 应用程序提供支持。 它的承诺很简单: […]

大模型内核
Sep 22, 2025

楔形陷阱

在这场 AI 淘金热中,从长远来看,深度将胜过速度 本文信息来源:nikunjk 当我问到扩张计划时,创始人的眼角抽动了一下。十八个月,融资三千万美元,成千上万人在使用他们的 AI(已编辑)工具。 “我们在考虑接下来增加邮件序列功能。” 一家公司发现,他们的楔子已经变成了棺材。 AI 淘金热带来了一种新病。每个 VC 都希望在 A 轮前达到 100 万美元的 ARR。每个创始人都知道公式:封装 GPT-5,加上身份验证,收取企业级价格。你会达成里程碑,你会完成融资,但你可能永远无法打造一家值得风险投资支持的公司。 风投们很懂这一套。他们会投资三十个简单的楔子型项目,明知其中二十九个会停滞在 500 万美元的规模。他们赌的是其中一个会意外地构建出有护城河的产品。剩下的则会变成收购式招聘(acquihire)。 大多数创始人会上钩。简单的楔子型项目容易融资。“AI for X”可以写在咖啡餐巾纸上。“我们要重建整个技术栈”听起来像是妄想。 最好的公司会选择这种“妄想”。 Figma 花了数年时间在浏览器中重构设计工具。实时协作需要彻底重新构想一切——冲突解决、内存管理、渲染性能。他们在竞争对手发布插件的同时构建了自己的图形引擎。如今,那些竞争对手反过来乞求获得其基础设施的 API 访问权限,而这些基础设施他们永远无法复制。 Notion 质疑为什么文档和数据库要分开。自定义状态管理。专有同步引擎。三年没人理解的区块架构。如今,模仿者才发现,他们的基础在 Notion 轻松发布的新功能下开始崩裂。 我是在看着四家初创公司以同样的方式倒下时学到的。它们都建立在别人的核心价值主张之上。当底层平台发生变化、转型,或通过定价将它们排挤出去时,它们就一无所有。这个楔子从来不属于它们。 加速器的 Demo Day 证明了这种模式。三十个 AI SDR 项目上线。二十八个是相同的 ChatGPT 封装器。两个直接集成到客户的 CRM 中,从每一笔丢失的交易、每一次成功的销售流程、每一种异议模式中学习。OpenAI 在公共销售知识上训练。这两个则在私有交易结果上训练。一个在普遍意义上提升,另一个则专门为付费客户提升。 我的测试是:仅凭你的楔子,能否单独做到 1 亿美元?没有相邻产品,没有平台故事,只有这个楔子。 创始人开始慌了。他们列出相关功能、扩张计划、生态系统愿景。在融资演示文稿中坦白楔子只是一个功能。 陷阱在规模化时触发。你最大的客户需要一些你的架构无法实现的东西。你的团队调整提示词而不是训练模型。你添加聊天小部件,以为动作就等于进展。每一个功能都让转型更难。每一个客户都让改变变得不可能。 你的楔子变成了你的命运。无论客户在第一天认为你是什么,你五年后仍在为此奋斗。 真正的楔子看起来窄,但深入。困难的问题会叠加成竞争护城河。每一个技术决策都至关重要。你避免的每一个依赖都会成为永久的优势。 年收入 $100 […]