跳到正文
原文
AGI Hunt· IanOsband·· 4 小时前AI 评分48

DeepMind 研究员 Ian Osband:图像分类中策略梯度仅 4% 准确率,远逊交叉熵 62%

DeepMind 研究员指策略梯度在图像分类中远逊交叉熵

AI 导读

DeepMind 研究员 Ian Osband 通过图像分类实验质疑后训练中被默认当作「唯一 RL 损失」的策略梯度方法:在 ImageNet 等任务上它仅约 4% 准确率,交叉熵损失达 62%。他指出,后训练失败时业界习惯归咎于探索、信用分配等 RL 经典难题,但实验表明策略梯度本身可能存在根本性缺陷。相关结果引发了社区对后训练损失选择的讨论。

来源:AGI Hunt · agihunt.info