热点事件持续更新
DeepMind研究员称策略梯度图像分类远逊交叉熵
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
2026年10月5日,AGI Hunt 报道,DeepMind 研究员 Ian Osband 通过图像分类实验对后训练中被默认当作「唯一 RL 损失」的策略梯度方法提出质疑:在 ImageNet 等任务上,策略梯度仅取得约 4% 准确率,而交叉熵损失达 62%。Osband 指出,后训练失败时业界习惯归咎于探索、信用分配等强化学习经典难题,但该实验表明策略梯度本身可能存在根本性缺陷。相关结果引发了社区对后训练损失选择的讨论。目前该事件仅有这一篇报道,尚无其他方面的回应或后续验证。
AI 根据报道生成 · 2 小时前更新
最新进展10月5日 21:34
DeepMind 研究员 Ian Osband 称图像分类中策略梯度仅约 4% 准确率,远低于交叉熵的 62%。报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- AGI HuntDeepMind 研究员 Ian Osband:图像分类中策略梯度仅 4% 准确率,远逊交叉熵 62%
DeepMind 研究员 Ian Osband 通过图像分类实验质疑后训练中被默认当作「唯一 RL 损失」的策略梯度方法:在 ImageNet 等任务上它仅约 4% 准确率,交叉熵损失达 62%。他指出,后训练失败时业界习惯归咎于探索、信用分配等 RL 经典难题,但实验表明策略梯度本身可能存在根本性缺陷。相关结果引发了社区对后训练损失选择的讨论。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。