跳到正文
原文
BAIR:Berkeley AI Research Blog·· 2025-11-01AI 评分47

BAIR:不依赖 TD 学习的 RL,分治法价值学习

RL without TD learning

AI 导读

BAIR 博文提出一种基于分治法的 RL 算法,不依赖 TD 学习做价值学习,理论上把 Bellman 递归次数从线性降到对数,从而扩展到长时序任务。在一项与 Aditya 共同主导的工作中,该方法已用于 goal-conditioned RL,作者称这是首个把分治价值学习规模化的工作。但如何选取最优子目标 w 仍不清楚。

来源:BAIR:Berkeley AI Research Blog · bair.berkeley.edu