跳到正文
原文
AGI Hunt· rickasaurus·· 5 小时前AI 评分41

模型为何死磕到底:RL 训练让 AI 不会知难而退

AI 导读

模型在看似不可能完成的任务上也不放弃,原因被归结为 RL 训练机制:轻易放弃会被当作失败样本,训练会一直持续到它们不再放弃为止,于是「高持久性内部模型」成了标配,没有会「躺平」的版本。这一观察来自 Tetraspace West,由 rickasaurus 转发调侃。

来源:AGI Hunt · agihunt.info