“验证税”的重担:当 AI 生成效率翻倍,为什么我们的调试成本反而飙升?
地面真相

将AI作为主要工作驱动九个月后,审查时间成了瓶颈。资深从业者群体中正在形成一种解决方案,随之而来的还有一个公司级架构问题。
我大部分工作日都在Claude Code中开始。任何重复性的、可编码的、耗时超过十分钟的工作,我都尽量委托给AI智能体。在任何时刻,我都有五到六个并行的智能体会话在运行,我的工作就是在它们之间切换,检查输出、给出方向,然后继续推进,让它们持续工作。这样一来,我就能将有限的精力集中在那些真正只有我能做的事情上——至少目前如此。
九个月下来,我用得越多,就越想继续用。但数学上存在一个极限:我无法在将产出提升五倍的同时,也将审查时间提升五倍。
管理类比
大约在一月份,一种反复出现的挫败感让我意识到:应该有一种方法,能将Claude每次犯的错误都编码记录下来。我讨厌低效,而代码的美妙之处就在于你可以将其系统化。
这与管理的原则如出一辙。当你团队中的某个人犯了错误,你会在一对一沟通中与他复盘,帮助他内化教训,希望这个错误不再重演。在概率机器之上叠加代码,可以比人类的内化更可靠——前提是你知道如何将规则编码到系统中(而不是仅仅依赖人类的记忆)。
结果就是我开发了一个名为”学习循环”的Claude Code技能,每次会话后运行它来捕获经验教训。没有它,我就会原地打转,五个月后Claude还会犯同样的错误。订阅
正在形成的共识
如果管理不善,验证成本会与产出线性增长,瓶颈只是转移而非消失。大多数应对方式(如涌现的代码审查初创公司、组织层面的”人在回路中”、个人层面干脆放弃”使用AI”)都只是转移了成本,而没有真正降低它。
但过去几个月里,资深从业者群体中正在形成一种不同的应对方式,散见于他们的文章和X帖子中。Garry Tan将其版本称为”技能化”:
“我的智能体这周搞砸了两次。这两次失败都不能再发生。不是因为我好好说。而是因为我把每次失败都变成了永久性的结构性修复:一个带有测试的技能,每天、永远运行。”
Anthropic的Claude Code负责人Boris Cherny在2026年1月的Claude Code公开帖子中表达了同样的思路:”更新你的CLAUDE.md,这样你就不会再犯那个错误了。”Mitchell Hashimoto和OpenAI Codex团队也提出了各自的变体。
这种做法的有效性在于,约束框架是可修改的。所谓”约束框架”,我指的是Garry Tan所说的”运行LLM的程序”。它的四个职责是:在循环中运行模型、读写你的文件、管理上下文、以及强制执行安全。这个脚手架必须存在于某个层面:个人、团队或组织层面。没有它,每次会话都从空白开始,验证税就会在下游不断累积。
两个层面的验证
验证工作分为检测和上游工程。
检测是第一步:抽查、”展示你的工作”纪律、以及在输出时进行审查。这些能捕捉到更多错误。你可以利用一些巧妙的审查技术(例如专家或对抗性审查子智能体)来让审查更快、更彻底,但这与提升系统级效率不是一回事。
上游工程才是产生复利的地方。每个被捕获的错误都变成一条永久规则,阻止同样的错误再次发生。随着时间的推移,出现在审查步骤中的错误会越来越少。
运行我构建的”学习循环”技能五个月后,我得出一个结构性观察:验证步骤并没有膨胀,因为大多数潜在错误都在源头被工程化地消除了。我花了相当多的时间来编写上游工程,但我将其视为有价值的投资,它们在下游产生复利,帮助我扩大产出而不必扩大审查时间。
公司级架构
我和NextView的一位合伙人正在分工合作一个项目。我们俩都用Claude Code作为主要工作驱动,他负责处理的一部分工作在我的上游。
当我开始在此基础上构建时,我对自己的工作进行了多轮审查,却意外地发现他负责的部分中有十分之九存在明显的偏差:编造的统计数据和引用,其内容与声称的并不相符。我的合伙人很聪明,工作能力也很强;差距在于验证工具包。如果没有上游工程化的检测层,这些错误就会累积到我的下游工作中。
这是两人规模的版本。扩展到公司层面,这种模式会成倍放大(共享智能体、智能体之间的交接、没有集中的审查瓶颈):两个同事可能会遇到一次这种情况;两百个员工共享同一套智能体则会不断遇到。构建与采购的重新定位提出了哪些能力应该自建、哪些应该采购的架构问题;验证基础设施现在也成了这个清单上的一个项目。默认的应对方式——”下游的人来把关”——不仅无法以有意义的方式扩展你利用AI的能力,还会让团队中验证能力最弱的人成为团队的实际天花板。
这个问题可以在两个层面解决,尽管两者都不简单。
在个人层面,做法是赋能并教育每个构建者维护自己的”学习循环”:每个被检测到的错误都成为他们永久的约束框架规则。在组织层面,这本身就是一个自建或采购的问题。采购方面:验证循环类别中有一批不断增长的供应商。自建方面:建立对约束框架规则、错误编码化、以及从生产环境反馈回每个人AI栈的路径的内部所有权。
资本流向
资本开始涌入供应商一侧,但有两个相邻的类别值得区分。传统的评估和可观测性平台(Braintrust、Arize、LangSmith、Patronus AI)根据预定义的成功标准来监控和评分模型输出。对于通用型智能体而言,定义”正确”本身就是工作,这些平台是必要但不充分的。
自我改进是下一个层次:捕捉会话中的失误、分析根本原因、并以比传统评估/可观测性更少的人工干预来重新调整提示词或约束框架。Lemma声称能检测语义失败并自动生成提示词改进。企业AIOps领域的现有玩家InsightFinder已扩展到AI工作流的自动根本原因分析。Judgment Labs则采取了不同的角度:分解智能体运行过程中出错的环节,作为一个持续改进层。Braintrust的”循环智能体”则是评估领域的现有玩家向同一层的延伸。这个类别本身还太年轻,尚未出现明确的赢家。
在过去十二个月里,有四家独立公司被收购:Cisco收购了Galileo,OpenAI收购了Promptfoo,Anthropic收购了HumanLoop(2025年9月停运),ClickHouse收购了Langfuse。验证是作为一个独立层存活下来,还是被吸收进模型平台,是这个类别面临的一个开放性问题。
AI能力研究组织METR追踪智能体任务停留在前沿的时间长度;他们最新的更新显示,任务时间跨度现在每3.5个月翻一番,而之前是七个月。随着能力护城河逐渐消融,验证循环基础设施是另一个方向上产生复利的层面。
什么在与模型赛跑
对于大多数团队来说,扩展AI辅助产出的约束性瓶颈就是验证循环。那些能善用AI的团队(无论是在个人还是组织层面),是那些约束框架每周都变得更难被攻破的团队。随着能力持续加速,护城河就在于那些与之赛跑的东西。
地面真相系列前文:信心差距指出AI信心与AI正确性并不相关,这是本文所基于的基础。谁捕获价值?将验证定位为执行的稀缺互补品;本文则探讨验证基础设施在实践中的样貌。判断层将不可验证的决策分解为可验证的子决策加上不可还原的判断;本文论证了可分解部分的验证工作需要其自身的架构。