跳到正文
原文
arXiv cs.AI· Pedro Robles Dutenhefner, Dikshant Shehmar, Wagner Meira Jr., Marlos C. Machado·· 4 小时前AI 评分35

GITA:面向目标条件强化学习的多时间尺度学习

Learning Multiple Timescales for Goal-Conditioned Reinforcement Learning

AI 导读

Generalized Implicit Temporal Abstraction(GITA)把单个价值函数条件化在 k 上,并聚合多个 k 值下的优势加权监督来训练一个策略,使离线目标条件强化学习(GCRL)无需在局部分辨率与长程信号之间二选一。

来源:arXiv cs.AI · arxiv.org