深度文章
信息来源:melodykoh.substack.com 2026.02.09 00:47 约 7 分钟 企业级应用 持续阅读

结构性分化:为何企业级人工智能生产力落后于个人突破

RECODEX · 深度文章 企业级应用
结构性分化:为何企业级人工智能生产力落后于个人突破

在关于人工智能提升生产力的讨论中存在一种奇怪的脱节。

一方面: 麻省理工学院的“生成式人工智能差距”报告在去年夏天引发了轰动,该报告显示 95%的企业 AI 试点没有带来可衡量的损益影响。另一方面:Lenny Rachitsky 的调查对产品经理、工程师、设计师和创始人进行的调查发现,55%的人表示人工智能已超出他们的预期。近 70%的人报告工作质量有所提高。具体到创始人?49%每周节省超过 6 小时。

这两种叙事都是真的。我认为它们之间的差距是结构性的,而非行为性的。

个人生产力的正反馈循环是真实存在的

当我使用 Claude 时,我的上下文是受限的。所有内容都保存在本地文件、Markdown 文档和我能控制的文件系统中。相关信息集中在一个地方。我可以把我的职业经历、偏好、约束以结构化文本的形式倾倒进去——从此每次交互都建立在那个基础之上。

这是可行的,因为表面可管理——尽管搭建个人上下文基础设施也花了数月反复迭代才能做到位。上下文大致与投入成线性关系增长。到了企业级别,则呈组合式增长。

企业级上下文问题组合式更为复杂

xAI 的“人类模拟者”项目揭示了企业级 AI 自动化实际上需要什么。他们正在构建代号为“Macrohard”的 AI 系统,通过操作键盘、读取屏幕并在分散的系统间完成任务来模拟人类员工。这些 AI“员工”已在 xAI 内部部署。

最能说明问题的细节是:这些仿真器有时会因“幻觉”而造成混淆。一次,有个 AI 要求同事“过来当面说话”——结果那人来到却只看到一个空桌子。目标是实现一百万个人类仿真器,可能作为分布式算力运行在闲置的特斯拉车辆上。他们需要仿真器——而不仅仅是 API——这一点很有启发性:企业语境并不只存在于一个地方。它散落在 Slack、Google Docs、电子邮件线程、隐藏在附件里的电子表格、无人观看的会议录音,以及只存在于人脑中的部落知识里。

在组织层面复刻单个 Claude Code 的魔力并不是难十倍,而是难指数级增长。

四个结构性观察

1. 瓶颈在于语境,而非能力

AI 能力存在。大多数企业都能使用前沿模型。差距不在于 AI 本身——而在于连贯的上下文。当你独自工作时, 你就是上下文。你知道你的本意、之前尝试过的做法以及哪些约束重要。在组织层面,这些上下文分散在人员、系统和只有某些人记得的历史决策中,根本无处可寻。

MIT 的研究证实了这一点:“大多数生成式 AI 系统不会保留反馈、适应上下文或随时间改进。”失败的原因不是模型或基础设施——而是学习的缺口。

2. 以本地为先之所以奏效,是因为范围受限

Anthropic 将 Claude Code 构建在 markdown 文件和本地文件系统之上并非偶然。这个设计选择说明了一个问题:具代理性的 AI 在上下文有边界时效果最佳。一旦你试图把它扩展到团队成员、工具和流程,你做的就不再是一个功能——而是在构建基础设施。

3. 行为解释掩盖了结构性约束

当有人说“企业在采用人工智能方面进展缓慢”时,隐含的意思是这是人的问题——培训、文化、激励。但如果这是一个架构问题呢?如果企业的上下文层根本不存在,不管如何推动采用都无法改变这一点呢?

麻省理工学院的数据支持这一观点:80%的组织曾试点过 ChatGPT 或 Copilot。采用不是问题。问题是转型——而转型需要尚未存在的基础设施。

4. 大多数上下文基础设施关注错了问题

企业情境有两种类型:(1)存在于人脑中的隐性知识——判决、启发式规则、我们“实际上如何看待这件事”;(2)现有的工作产出,如文件、过去的决策和历史案例。

大多数工具侧重于从第二类中抽取信息,因为它可见且看起来可扩展。但衍生性指导需要大量标注才能做对,在纵向领域——结果需要数年才能显现——历史数据的价值可能没有直觉上那么高。

在 NextView 测试一个 AI 辅助交易评估系统的概念时,历史方法似乎显而易见:整理十年超过 100 份的投资备忘录、标注结果、基于涂装进行训练。概念验证显示出希望,但沿这条路走下去意味着要在一个长期的纵向体系中标注数以千计的交易——其结果需要多年才能显现——这似乎回报率很低。2015 年的交易能教我们如何评估 2026 年的创始人吗?

相反,我们从直接表达的判定入手:提示捕捉了资深投资人如今如何评估创始人、市场动态以及创始人与市场的匹配。这个方法奏效——该系统现在产生的需更正决策少于10%。传统方法或许仍有助于进一步缩小绩效差距,但直接路径让我们更快达到可用水平。

在这种框架不完全适用的情况下

本分析聚焦于知识型工作──那些以判断和默会知识为主的领域。有些企业级 AI 应用则不受这些限制:

  • 高度结构化的领域。 客服分流、发票处理和代码补全依赖显式规则。上下文是被定义的,而不是被发现的(或在代码情形下易于发现)。这些用例正在取得成功——而“95% 失败率”这一数据很可能低估了在更狭窄应用中的胜利。

  • 具备异常良好上下文治理的组织。 有些公司——通常规模较小或由工程主导——维持着将默会知识以书面形式保存下来的文档文化。对于他们来说,上下文差距更小。

强力押注可能奏效。我对以人为模型的仿真作为可扩展解决方案持怀疑态度,但如果计算成本下降速度快于上下文基础设施成熟的速度,仿真或许会胜过更优雅的架构。市场会做出决定。

结构性鸿沟确实存在,但并非普遍适用。问题在于,你的企业级人工智能目标是属于那 80% 需要上下文基础设施的用例,还是属于那 20% 不需要的用例。

这对创始人意味着什么

如果你正在为企业构建人工智能,问题不是“我们如何让 AI 更聪明?”,而是“我们如何构建共享的上下文基础设施?”解决上下文问题——而不仅仅是能力问题——的公司将获得不成比例的价值。

不同公司在押注不同的方向:

  • xAI 的做法: 人类模拟器,用以在现有碎片化系统中导航——成本高、脆弱,仿真复杂性而非降低复杂性。

  • 记忆层初创公司如 Mem0Letta(从伯克利的 MemGPT 研究中分拆出来)和 Zep:持久化记忆让 AI 在会话间保留上下文——解决了“反复粘贴相同上下文”的问题。目前还没有公司明显领先;这场竞赛仍处于早期。

    Anthropic 的自下而上策略: 先通过 Claude Code 面向开发者,然后通过 Claude Cowork 面向“被命令行吓退的其他所有人”,再通过现有云合作关系扩展(AWS Bedrock、Google Vertex)。让个人先证明价值,再正式推进企业合作。

很可能存在比这些更好的路径:能帮助组织表达其支离破碎现实中连贯上下文的工具——不是从文档中提取,而是从真正掌握这些信息的人那里呈现出来。

这对运营者意味着什么

如果你个人因 AI 获得了巨大的生产力提升,别指望这种体验能直接复制到你的团队。瓶颈不在于教人如何提示——而在于构建能让这些提示发挥作用的上下文层。

从小处着手:一个共享的决策库,一份持续更新的约束文档,任何能把语境从人脑中外化的东西。目的不是用公司文档训练模型,而是帮助掌握默会知识的人,把这些知识表达成 AI 可以使用的形式。


MIT 的统计数据和建设者的宣传可以并存,因为他们测量的并不相同。个人的 AI 生产力需要能力加上个人语境。企业的 AI 生产力需要能力加上共享语境——而那样的基础设施几乎不存在。

结构性鸿沟不会因为更好的模型而消失。它会因为更好的语境架构而弥合。

了解 RecodeX 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读