AGI Hunt· IanOsband·· 4 小时前AI 评分39
Ian Osband 提出 horizon loss:把 cross-entropy 按剩余训练预算截断
Ian Osband 提出 horizon loss:把 cross-entropy 按剩余训练预算截断
AI 导读
Ian Osband 提出 horizon loss,将 cross-entropy 按剩余训练预算截断,一行代码即可实现。他把 cross-entropy 定义为“耐心的准确率”,即一个样本若无限期训练下去最终要付出的总误差,而 policy gradient 是这个总量的零视界极限。
来源:AGI Hunt · agihunt.info