AGI Hunt· tokenbender·· 1 天前AI 评分30
采样 softmax 为何把训练提速 1.7 倍:@tokenbender 拆解其偏差代价
采样 softmax 为何把训练提速 1.7 倍:X/@tokenbender 拆解其偏差代价
AI 导读
@tokenbender 拆解了采样 softmax 把训练从 67s 提速到 39.9s(1.7 倍)的原理与偏差代价。LM head 对 5 万个 logits 的交叉熵每步吃掉相当大比例算力,而按 Zipf 分布概率质量集中在几千个 logits 上,无需对全部 logits 计算,几乎不损失精度。代价是自归一化带来严重偏差,系统性欠训练尾部 logits。
来源:AGI Hunt · agihunt.info