跳到正文
热点事件持续更新

DeepMind研究员称策略梯度图像分类远逊交叉熵

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月5日,AGI Hunt 报道,DeepMind 研究员 Ian Osband 通过图像分类实验对后训练中被默认当作「唯一 RL 损失」的策略梯度方法提出质疑:在 ImageNet 等任务上,策略梯度仅取得约 4% 准确率,而交叉熵损失达 62%。Osband 指出,后训练失败时业界习惯归咎于探索、信用分配等强化学习经典难题,但该实验表明策略梯度本身可能存在根本性缺陷。相关结果引发了社区对后训练损失选择的讨论。目前该事件仅有这一篇报道,尚无其他方面的回应或后续验证。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. AGI Hunt
    DeepMind 研究员 Ian Osband:图像分类中策略梯度仅 4% 准确率,远逊交叉熵 62%

    DeepMind 研究员 Ian Osband 通过图像分类实验质疑后训练中被默认当作「唯一 RL 损失」的策略梯度方法:在 ImageNet 等任务上它仅约 4% 准确率,交叉熵损失达 62%。他指出,后训练失败时业界习惯归咎于探索、信用分配等 RL 经典难题,但实验表明策略梯度本身可能存在根本性缺陷。相关结果引发了社区对后训练损失选择的讨论。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。