本文将涵盖:

  • 为什么可验证性是关键约束

  • 当前有效的技术

  • 正在攻克这一难题的公司

一、可验证性约束

过去一年取得进展的一个重要原因是可验证奖励的强化学习(RLVR)。其核心理念很简单:为模型提供答案可核查或可验证的问题,让模型通过推理找到解决方案,并对得出正确答案的尝试进行强化。

数学与代码堪称完美契合,我们已见证了相应进展。其验证机制清晰且成本低廉,可进行数百万次迭代测试。这种持续攀登的成效在 SWE-bench 基准测试的进步中清晰可见。到 2025 年,OpenAIGoogle DeepMind 均在国际数学奥林匹克竞赛中斩获金牌级表现——在多数顶尖本科生都难以企及的题目中,各自拿下 42 分满分中的 35 分。

Jason Wei(时任 OpenAI)将此总结为”验证者定律”:训练 AI 完成任务的难易程度,大致与任务的可验证性成正比。任何能够快速客观验证的任务,都可以通过强化学习反复打磨直至成功。

关键在于,大多数有价值的工作未必容易验证。写好一份备忘录或做好一项设计并没有现成的测试方案,更不用说像创办企业这样需要长期投入、依赖现实世界反馈的事情了。

因此,在“不可验证领域”中,整个游戏归结为一个问题:当答案无法轻易核实时,奖励从何而来?

这个问题并不新鲜。RLHF 和 Constitutional AI 本质上都是在回答同一个问题:“当没有验证手段时,你该怎么办?”

RLHF 通过在人类偏好(这两个答案中哪个更好)上训练独立的奖励模型,随后优化模型以获取更高评分。Anthropic 在所有 Claude 模型上使用的宪法式 AI,则将大部分人类反馈替换为由书面原则指导的 AI 反馈。

这些方法虽然起到了某种对齐作用,但并未在主观领域带来像 RLVR 在数学和代码领域所实现的那种能力飞跃,而且可以说这些方法更注重优化用户参与度而非能力提升。那么,我们还能通过哪些方式为主观领域获取验证器或奖励信号呢?

二、技术手段

目前有几种不同的方法正在尝试验证那些不易验证的内容。

将评分标准作为奖励。Scale AI 在 2025 年中发布了一篇相关论文。针对每个提示,生成一个实例特定的评分标准,即一份优秀答案应满足的检查清单,通常以人类专家为基准。由 LLM 裁判根据该清单对每次尝试进行评分,该分数即成为奖励。

这种方法之所以有效,是因为它将验证难以回答的问题分解为许多更小的“是/否”或基于评分的问题。与其让评判者给出一个“这个好不好?”并得到一个信噪比很低的 1 到 10 分评分,不如询问“它是否提到 X、避免 Y、处理好 Z?”,而每个这样的问题都更容易核查。Scale 报告称,在医疗基准测试 HealthBench 上,使用这种方法相比简单评判打分取得了高达 31%的相对提升。后续工作如 OpenRubrics 现在专注于大规模生成这些评分标准。这正是法律、医疗、金融等领域许多数据提供商普遍采用的方法。

生成式奖励模型。这与 LLM 作为裁判的方法类似。奖励模型不是直接输出一个黑盒数字,而是先进行推理,再对答案进行评分。

过程奖励模型。这是一种对推理的每一步进行评分的方法,而不仅仅是最终答案,这对于长期任务和难以验证的任务更为关键。

共同的思路是,当无法通过编程创建校验器时,可以通过制定一系列评分标准来近似构建校验器,用于比对最终输出或中间阶段,并借助 LLMs 或类似模型依据这些标准进行评分。

三、涉足该领域的企业

多家公司正尝试以不同方法,在难以验证的领域中实现强化学习(RL)的应用。

Three approaches to RL beyond the verifiable

1. 向实验室销售验证器与数据。第一类公司正在这些领域构建程序化验证器和强化学习环境,并将其出售给实验室。常规做法是:由专家为特定任务编写评分准则,每条准则的具体程度需足以通过程序化方式核查,从而将模糊判断转化为可规模化评分的内容。Mercor、Surge、Micro1 等公司正采用这种基于评分准则的方法,应用于医疗健康、法律和金融等领域。而 Taste Labs 则明确瞄准设计、”品味”等难以验证的主观领域。他们特别指出,基于人类反馈的强化学习之所以陷入僵局,正是因为将所有人的偏好平均化后,最终会丧失真正的品味。

2. **将领域形式化。** 另一种方法是处理那些稍显模糊的领域,将其转化为机器能够直接验证的形式,然后在该垂直领域推广最终解决方案。在数学领域,这已经行得通:用像 Lean 这样的形式化语言编写的证明能自我验证,这就是为什么 DeepMind 的 AlphaProof 等系统能在无需人工参与的情况下获得奖励。

Pramaana Labs 正将该理念推向更复杂、风险更高的工作领域,利用形式化验证确保税务、法律和医疗等监管领域的答案可被验证。每当你成功将某个领域形式化,它便从”不可验证”的清单中移除。

3. 掌控全流程。另一类公司专注于答案难以验证但尚可验证的领域——只是不能在计算机上完成。你不能用评分标准或定理证明来检验一种新材料或新药,必须亲手进行实验。因此,这些公司自行掌控完整闭环:由 AI 提出方案,物理实验室进行测试,实验结果即为验证奖励。

由前 OpenAI 和 DeepMind 研究员创立的 Periodic Labs 正在运营机器人实验室以发现新材料。DeepMind 旗下药物发现衍生公司 Isomorphic Labs 将其预测建立在湿实验室及最终的临床现实中。Lila Sciences 则在生命科学与材料科学领域构建自主实验室。这些系统的核心理念在于:验证过程需在真实世界中进行,因此可能缓慢且昂贵,但通过掌控整个闭环,可以将奖励机制锚定在物理现实之中。

结语

在可验证领域,强化学习的效果已清晰可见,但下一轮重大突破将来自那些能够将同样进步推广至经济中更难验证的其他领域的方法与公司。当前基于可验证奖励的强化学习(RLVR)方法究竟能泛化到何种程度,抑或是否需要全新的技术突破,仍是悬而未决的核心问题。若您正在这些领域进行探索,我期待与您交流!

The economy by value and verifiability