Towards Data Science· Benjamin Nweke·· 7 天前AI 评分48
GRPO 如何用可验证奖励训练小语言模型
How GRPO Trains Small Language Models with Verifiable Rewards
AI 导读
GRPO 让模型对同一问题采样多次作答,用可验证奖励为每个答案打分,再以组内平均奖励为基线比较各次尝试来更新模型,无需单独的 critic。该方法由 DeepSeekMath 工作提出,用以替代传统 PPO 的内存开销,文中用「6 箱每箱 8 件、卖出 6 件、答案 42」的算术题演示打分与优势计算。组内奖励完全一致时优势全为零,模型无法判断该偏好哪次尝试。
来源:Towards Data Science · towardsdatascience.com