跳到正文
原文
AGI Hunt· generativist·· 2 小时前AI 评分43

网友质疑:模型被 RL 训成复杂推理表演,一追问就崩

网友质疑:模型被 RL 训成复杂推理表演,一追问就崩

AI 导读

有网友转发观点质疑:模型被 RL 训练成默认进行极度复杂的调查式长推理,但被问一个简单的后续问题时就彻底崩溃。该观点推测这种行为要么是为讨好人类、显得努力,要么是 tokenmaxx,即消耗更多 token。

来源:AGI Hunt · agihunt.info