RecodeX 重构消息,硅谷播客主持人Dwarkesh Patel提出,下一代AI能力的关键可能在于通过“可验证奖励强化学习”(RLVR)在可刷题任务(如代码、数学)中训练,并结合“在线策略自蒸馏”(OPSD)和“梦想”(dreaming)机制,实现从真实部署经验中持续学习并更新模型权重。