跳到正文
热点事件持续更新

随机化 20% 样本 SWA 跨度可加快收敛

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 7 日,kalomaze 分享了其刚刚验证的训练基线实验:对 20% 的样本,把所有层的全量 SWA(滑动窗口注意力)跨度在 2 的幂 128 到 512 之间随机化,观察到明显改进。其给出的原理是,即便 RLVR 的答案对模型是 held-out 的,这种做法也强迫模型通过推理推导出正确答案,从而刻意制造更严酷的信息不对称。与常规数据增强不同,这种方式在总信息更少的情况下,反而让全序列长度的损失下降更快。该结果目前来自 kalomaze 个人的基线实验分享,报道中未提及复现或第三方验证情况。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    kalomaze:随机化 20% 样本的 SWA 跨度,全序列损失收敛更快

    kalomaze 分享刚验证的训练基线实验:对 20% 的样本,把所有层的全量 SWA(滑动窗口注意力)跨度在 2 的幂 128 到 512 之间随机化,观察到明显改进。其原理是即便 RLVR 答案对模型是 held-out 的,也强迫模型通过推理推导正确答案,从而刻意制造更严酷的信息不对称。与常规数据增强不同,这种方式在总信息更少的情况下反而让全序列长度的损失下降更快。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。