arXiv cs.AI· Pedro Robles Dutenhefner, Dikshant Shehmar, Wagner Meira Jr., Marlos C. Machado·· 4 小时前AI 评分35
GITA:面向目标条件强化学习的多时间尺度学习
Learning Multiple Timescales for Goal-Conditioned Reinforcement Learning
AI 导读
Generalized Implicit Temporal Abstraction(GITA)把单个价值函数条件化在 k 上,并聚合多个 k 值下的优势加权监督来训练一个策略,使离线目标条件强化学习(GCRL)无需在局部分辨率与长程信号之间二选一。
来源:arXiv cs.AI · arxiv.org