AGI Hunt· meituan-longcat·· 4 小时前AI 评分41
美团 LongCat 提出 N-OPSD:邻近专家池自蒸馏,AIME 均值最高提升 2.75 分
AI 导读
美团 LongCat 团队提出 N-OPSD,用离线贪心筛选的冻结专家池和 MaxPeak 在线路由改进 on-policy self-distillation 数学推理训练。在 AIME 2024/2025 与 HMMT Feb 2025 上,Qwen3-1.7B/4B/8B 的 Average@12 分别比 OPSD 提升 2.75、1.67、1.94 分。推理时只需蒸馏后的学生模型。
来源:AGI Hunt · agihunt.info