arXiv cs.AI· Haomin Luo (University of Cambridge, Models2 AI)·· 5 小时前AI 评分35
Disco103 自我发现式 RL 规则审计:学习历史是资产还是负担?
Self-discovering RL in the Era of Experience: Is Learning History an Asset or a Burden?
AI 导读
研究者对自我发现的 RL 规则 Disco103 做了首次因果机制审计,测试学习历史何时是资产、何时是负担。结果显示,循环历史能把可用奖励尺度窗口维持到六个数量级,而 zero-pinning 下仅三个数量级;不匹配历史的惩罚源自持续钳制,让导入状态自然演化可减轻这一负担。
来源:arXiv cs.AI · arxiv.org