AGI Hunt· ChengleiSi·· 3 小时前AI 评分53
Dust 零阶预训练复现存疑:配 AdamW 落后约 1 nat,多耗约 2000 倍 GPU 时
Dust 无反传预训练复现存疑:配 AdamW 落后约 1 nat 且多耗 2000 倍 GPU 时
AI 导读
有研究者复现了 Dust 这一零阶预训练方法,发现原始数字本身真实,但只在同样使用 SGD 时与 backprop 打平。换用 AdamW 后,backprop 在 10M tokens 处领先约 1 nat,Dust 用 Adam 也落后 0.5 nat,达到该效果需约 2,000 倍于 backprop 的 GPU 时。
来源:AGI Hunt · agihunt.info