热点事件持续更新
Dust 零阶预训练复现:AdamW 下落后约 1 nat
1 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
Dust 是一种零阶(zeroth-order)预训练方法。有研究者对其做了复现:原始报道中的数字本身真实,但只在同样使用 SGD 优化器时,Dust 才与反向传播(backprop)打平。复现进一步显示,若把优化器换成 AdamW,backprop 在 10M tokens 处领先约 1 nat;Dust 改用 Adam 也落后 0.5 nat。同时,Dust 要达到该效果,需要约 2,000 倍于 backprop 的 GPU 时。也就是说,Dust 的优势高度依赖优化器设置,换用 AdamW/Adam 后不再与 backprop 持平,且计算代价极高,其实用性因此存疑。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 13:16
复现显示 Dust 换用 AdamW 后落后 backprop 约 1 nat,并需约 2000 倍 GPU 时。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- AGI HuntDust 零阶预训练复现存疑:配 AdamW 落后约 1 nat,多耗约 2000 倍 GPU 时
有研究者复现了 Dust 这一零阶预训练方法,发现原始数字本身真实,但只在同样使用 SGD 时与 backprop 打平。换用 AdamW 后,backprop 在 10M tokens 处领先约 1 nat,Dust 用 Adam 也落后 0.5 nat,达到该效果需约 2,000 倍于 backprop 的 GPU 时。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。