Towards Data Science· Utkarsh Mangal·· 2 天前AI 评分39
Grokking:神经网络在看似训练完成后才学会真正理解
The AI That Learned to Understand Long After It Stopped Trying
AI 导读
小型神经网络在模加法任务上训练到 20000 步时,对新问题的准确率从 1000 步时的约 10% 跃升至接近 100%,这一现象被命名为 grokking。2023 年的后续研究发现,网络自行学会把数字表示为圆上的位置并用旋转组合,相当于重新发现了三角函数。研究者指出,标准 early stopping 规则可能在性能平台期提前切断训练,而 grokking 目前仅在少数窄的规则任务中被记录。
来源:Towards Data Science · towardsdatascience.com