原文:The Power of the AI Harness: Long Live the Application Layer
作者:David Talpalar, GP @ Shirlawn
来源:SandHill.io #299 推荐阅读 · Investment Themes & Theses

NVIDIA 上周五发布了一项里程碑式研究,证明了 harness(驾驭层/外围软件)的巨大价值——进而也证明了应用层本身的价值。

所谓 AI harness,是包裹在 AI 模型周围、把它变成主动 Agent 的外围软件基础设施。Harness 管理多步骤流程,促成与外部工具的连接;它们追踪记忆,并强制执行安全规则。

我用定义开场,是因为从第一天起——无论我们有没有意识到——AI harness 就处在 AI 讨论的中心。

AI 时代的首要问题之一是:在一个 AI 极其强大的世界里,价值归谁?我们已经有了一些答案。AI 对电力与基础设施产业极其有利。AI 显然也在模型层创造价值——OpenAIAnthropic 合计约 2 万亿美元估值就是例证。

Harness 是应用层的基础。一度被贬为不过是「模型套壳」(model wrapper),应用层已被证明比一些怀疑者最初以为的更耐久、更强大、更有价值。且不说这些应用层公司——例如 Cursor、Cognition、HarveyLegora——已经在它们之间建立起数千亿美元企业价值,我们现在还有可量化的数据,显示一个好 harness 有多强。

NVIDIA 上周五发表的新研究报告表明,相对于模型独自行动,一个好 harness 可以有多强大。Nvidia 研究者让 Claude 的 Opus 5 模型在交互推理基准 ARC-AGI-3 上拿到了 100% 的分数。AA3 是一组没有说明书的游戏,模型必须自己搞清楚怎么玩、怎么赢——所用推理与人类在同样情境下类似。没有 harness,Opus 5 得了 30%——这已是所有被测模型中最好的结果。

这项研究与应用层的关系

这个差距有多大,再怎么强调都不为过。我读完了小学。我知道考 100% 的学生和考 30% 的学生之间的差别。

这项研究直接告诉我们的,适用于垂直领域里的 harness。应用层公司的价值,就在它们的 harness 里。结论很直白:专门化应用可以显著优于 LLM 本身。应用层管理多步骤流程、连接到外部工具、追踪记忆、强制执行安全规则的能力,正是客户愿意为这些供应商付钱的原因。

性能至关重要,但它只是三个重要维度之一。对任何给定任务,harness 的工作之一,是决定该把成本、性能、速度各自加权到多强。这是一个非常复杂的问题。对任何一个 AI Agent,日常可能必须解决成百上千个给定问题。每一个都需要审慎思考:输出应该落在成本-性能-速度这个三维空间的何处。这也是一个动态问题:模型公司几乎每周都在推出新版本。把这一切考虑进去,你就会明白:建造并维护完美的 harness,是一份全职工作。

在一个有 harness 的世界里,模型显然也有价值。我们可以把模型想成大脑,而 harness 是 AI Agent 的身体。随着大脑变强,身体也能执行更复杂的操作。每一次模型迭代,都会解锁新的一小类任务,等着新的 harness 去解决。

Nvidia 的研究就是证据

风投圈眼下有一种主流共识:现在唯一值得建的公司是深科技和 AI 原生服务公司——这种心态由需要足够大空间来支撑其回报的数十亿美元级基金驱动,因为(1)这些空间足够大,撑得起它们需要的结果,(2)这些公司有护城河,不太可能被模型公司本身脱媒。它们忽视应用层,是自担风险。

我今天本想写更长一篇,但有时少即是多。数据比我能讲的故事更好,所以值得再重复一遍:Nvidia 的研究表明,带上 harness 的模型,在某些任务上可以从 30% 的表现走到 100%。单凭这条证据,我就很清楚:垂直应用层有太多东西可建,而且短期内这一点不会改变。


本文由 RecodeX 编译自 SandHill.io #299 推荐阅读,原文链接与作者见文首;原文版权归原作者所有,译文仅供学习交流,如有异议请联系我们处理。