热点事件持续更新
Disco103 自我发现式 RL 规则首次机制审计
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
2026 年 9 月 30 日,arXiv cs.AI 刊出一项针对自我发现式强化学习规则 Disco103 的研究,对其做了首次因果机制审计,核心问题是学习历史何时构成资产、何时成为负担。报道给出的结果显示:循环历史能把可用的奖励尺度窗口维持到六个数量级,而在 zero-pinning 条件下仅能维持三个数量级。研究还指出,不匹配历史所带来的惩罚源自持续钳制,若让导入状态自然演化,可以减轻这一负担。该事件目前仅有这一篇报道,尚无后续进展或其他来源的独立验证。
AI 根据报道生成 · 3 小时前更新
最新进展9月30日 12:00
Disco103 首次因果机制审计:循环历史可把奖励尺度窗口维持至六个数量级,zero-pinning 仅三个数量级。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv cs.AIDisco103 自我发现式 RL 规则审计:学习历史是资产还是负担?
研究者对自我发现的 RL 规则 Disco103 做了首次因果机制审计,测试学习历史何时是资产、何时是负担。结果显示,循环历史能把可用奖励尺度窗口维持到六个数量级,而 zero-pinning 下仅三个数量级;不匹配历史的惩罚源自持续钳制,让导入状态自然演化可减轻这一负担。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。