热点事件持续更新
OASIS 用已验证轨迹修复自蒸馏缩放失效
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026 年 10 月 1 日报道,在线策略自蒸馏(OPSD)存在随模型规模增大而失效的问题。OASIS 提出的做法是:主要监督经标签验证的在线策略轨迹,并用未验证的模型自生成尝试替代书面参考解答,作为 teacher 上下文。在 Qwen3-1.7B/4B/8B 三个规模上,针对 AIME 2024、AIME 2025、HMMT 2025 三个评测集,OASIS 较基线平均提升 3.2–3.8 分;在 8B 规模下比 OPSD 高出 3.05 分。目前该工作以报道形式公布,未见更多后续进展。
AI 根据报道生成 · 1 小时前更新
最新进展10月1日 17:17
OASIS 公布:在 Qwen3 8B 上较 OPSD 高 3.05 分,三评测集平均提升 3.2–3.8 分。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- AGI HuntOASIS 用已验证轨迹修复自蒸馏缩放失效,8B 模型 AIME 提升 3 分以上
OASIS 通过主要监督经标签验证的在线策略轨迹、并用未验证的模型自生成尝试替代书面参考解答作为 teacher 上下文,修复了在线策略自蒸馏(OPSD)随模型规模增大而失效的问题。在 Qwen3-1.7B/4B/8B 上针对 AIME 2024、AIME 2025、HMMT 2025,OASIS 较基线平均提升 3.2–3.8 分,8B 规模下比 OPSD 高 3.05 分。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。