AGI Hunt· Snapchat·2026-10-07 20:17· 4 小时前AI 评分34DiffGate:只对失败轨迹施加教师指导,让 GRPO 蒸馏 pass@8 最多提升 5.7 点AI 导读DiffGate 提出难度门控的 on-policy 蒸馏目标,只对失败轨迹施加教师指导并结合 GRPO,在 Qwen3-0.6B/1.7B 学生模型上把代码 pass@8 较 GRPO 提升 +1.6/+5.7 点、avg@8 提升 +1.7/+1.8 点。来源:AGI Hunt · agihunt.info#论文/研究#推理#数据/训练查看事件全部后续