跳到正文
原文
AGI Hunt· glenbeer·· 4 小时前AI 评分26

一图看懂 RLHF:从 SFT 到奖励模型再到 PPO 的三步流程

AI 导读

RLHF 流程被拆解为三步:监督微调(SFT)、训练奖励模型、强化学习优化。SFT 用人类高质量示范回答对 LLM 做监督微调,让模型先学会答得好;奖励模型用人类对不同回答的排序偏好数据训练,让模型知道人类更喜欢什么。最后用 PPO 更新策略,使模型生成奖励更高的回答,并以 KL 惩罚约束其不偏离原始 SFT 模型太远。

来源:AGI Hunt · agihunt.info