arXiv cs.AI· Akhil Bagaria, Anita De Mello Koch, George Konidaris·· 4 小时前AI 评分33
超越状态到达:面向内在动机选项发现的抽象学习
Going Beyond State-Reaching: Learning Abstractions for Intrinsically Motivated Option Discovery
AI 导读
一种新算法不再让子目标同时覆盖状态所有方面,而是为每个子目标识别少量相关特征,生成泛化更广、加速探索的选项。现有 option discovery 算法采用 state-reaching,导致选项仅适用于狭窄状态区域、数量爆炸并阻碍奖励最大化。该方法学习抽象可迁移选项,在三个稀疏奖励图像域(含 Atari 游戏 MontezumasRevenge)中实现快速探索。
来源:arXiv cs.AI · arxiv.org