RecodeX 重构消息,研究人员提出一种名为Transitive RL的新型强化学习算法,采用分治范式替代传统时序差分学习,旨在解决长时程任务中离线策略强化学习的可扩展性问题。
研究人员提出一种名为Transitive RL的新型强化学习算法,采用分治范式替...
原始信息来源bair.berkeley.edubair.berkeley.edu
查看原文 ↗RecodeX 重构消息,研究人员提出一种名为Transitive RL的新型强化学习算法,采用分治范式替代传统时序差分学习,旨在解决长时程任务中离线策略强化学习的可扩展性问题。