跳到正文
热点事件持续更新

EMNLP口头报告:RL训练解锁模型参数化知识

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年9月30日,AGI Hunt 报道一篇入选 EMNLP 口头报告的论文。该研究发现,强化学习(RL)训练能让模型更高效地遍历自身的参数化知识,从而访问到 instruction-tuned 模型中原本无法触达的知识。论文给出的结论是:RL 训练不只是对齐行为,还能解锁基座模型中已经存在、但在指令微调阶段无法调用的知识。作者为 @alexxxzzz6825、@niloofarmire、@RylanSchaeffer 与 Manasa Kaniselvan。截至该报道,尚无后续进展或其他不同结论的报道。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. AGI Hunt
    EMNLP 口头报告:RL 训练让模型更高效遍历参数化知识

    一篇入选 EMNLP 口头报告的论文发现,强化学习能让模型更高效地遍历其参数化知识,从而访问到 instruction-tuned 模型中原本无法触达的知识。结论是 RL 训练不只是对齐行为,还能解锁基座中已有、但指令微调阶段无法调用的知识。作者为 @alexxxzzz6825、@niloofarmire、@RylanSchaeffer 与 Manasa Kaniselvan。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。