跳到正文
原文
AGI Hunt· _rockt·· 3 小时前AI 评分28

Frontier Learning:GRPO 下过易过难题零梯度,唯有能力边界处学习最有效

Frontier Learning:GRPO 下过易过难题零梯度,唯有能力边界处学习最有效

AI 导读

Meta 团队提出新论文 Frontier Learning,指出用 GRPO 训练 LLM 推理器时,模型总能解出或永远解不出的问题优势(advantage)为零、产生零梯度,学习只在能力边界处最有效。

来源:AGI Hunt · agihunt.info