AGI Hunt· kalomaze·· 3 小时前AI 评分43
kalomaze:随机化 20% 样本的 SWA 跨度,全序列损失收敛更快
训练小技巧:随机化 20% 样本的 SWA 跨度,全序列损失收敛更快
AI 导读
kalomaze 分享刚验证的训练基线实验:对 20% 的样本,把所有层的全量 SWA(滑动窗口注意力)跨度在 2 的幂 128 到 512 之间随机化,观察到明显改进。其原理是即便 RLVR 答案对模型是 held-out 的,也强迫模型通过推理推导正确答案,从而刻意制造更严酷的信息不对称。与常规数据增强不同,这种方式在总信息更少的情况下反而让全序列长度的损失下降更快。
来源:AGI Hunt · agihunt.info