热点事件持续更新
Ian Osband 提出 horizon loss
2 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
2026 年 10 月 5 日,AGI Hunt 报道 Ian Osband 提出一种名为 horizon loss 的损失函数,做法是把 cross-entropy 按剩余训练预算截断,据称一行代码即可实现。在该框架下,他把 cross-entropy 定义为“耐心的准确率”,即一个样本若无限期训练下去最终要付出的总误差,而 policy gradient 则被视作这个总量的零视界极限。早先报道未给出更多实现细节、实验数据或社区反馈。同日稍后的后续报道补充称,Osband 是 DeepMind 研究员,horizon loss 出自其论文 Planning to Learn,并称该损失统一了分类与强化学习。
AI 根据报道生成 · 22 分钟前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- AGI HuntDeepMind 研究员 Ian Osband 提出 horizon loss,统一分类与强化学习
DeepMind 研究员 Ian Osband 发布论文 Planning to Learn(arXiv:2610.03667),提出 horizon loss 这一新型损失函数,将 cross-entropy 按剩余训练预算截断,仅需一行代码即可实现。
- AGI HuntIan Osband 提出 horizon loss:把 cross-entropy 按剩余训练预算截断
Ian Osband 提出 horizon loss,将 cross-entropy 按剩余训练预算截断,一行代码即可实现。他把 cross-entropy 定义为“耐心的准确率”,即一个样本若无限期训练下去最终要付出的总误差,而 policy gradient 是这个总量的零视界极限。
本事件热度走势
当前热度 9·可比范围峰值 10(10月5日 23:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。