AGI Hunt· _rockt·· 3 小时前AI 评分28
Frontier Learning:GRPO 下过易过难题零梯度,唯有能力边界处学习最有效
Frontier Learning:GRPO 下过易过难题零梯度,唯有能力边界处学习最有效
AI 导读
Meta 团队提出新论文 Frontier Learning,指出用 GRPO 训练 LLM 推理器时,模型总能解出或永远解不出的问题优势(advantage)为零、产生零梯度,学习只在能力边界处最有效。
来源:AGI Hunt · agihunt.info