跳到正文
热点事件持续更新

Disco103 自我发现式 RL 规则首次机制审计

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026 年 9 月 30 日,arXiv cs.AI 刊出一项针对自我发现式强化学习规则 Disco103 的研究,对其做了首次因果机制审计,核心问题是学习历史何时构成资产、何时成为负担。报道给出的结果显示:循环历史能把可用的奖励尺度窗口维持到六个数量级,而在 zero-pinning 条件下仅能维持三个数量级。研究还指出,不匹配历史所带来的惩罚源自持续钳制,若让导入状态自然演化,可以减轻这一负担。该事件目前仅有这一篇报道,尚无后续进展或其他来源的独立验证。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv cs.AI
    Disco103 自我发现式 RL 规则审计:学习历史是资产还是负担?

    研究者对自我发现的 RL 规则 Disco103 做了首次因果机制审计,测试学习历史何时是资产、何时是负担。结果显示,循环历史能把可用奖励尺度窗口维持到六个数量级,而 zero-pinning 下仅三个数量级;不匹配历史的惩罚源自持续钳制,让导入状态自然演化可减轻这一负担。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。