AGI Hunt· HankYeomans·· 12 小时前AI 评分35
前沿模型被 RL 训练过头:什么问题都被当成改代码指令
前沿模型被 RL 炼过头:什么问题都当成改代码指令来执行
AI 导读
开发者吐槽新一代前沿模型因过度 RL 训练,默认把任何问题都当作执行指令、立刻动手改代码。典型场景是问「为什么 X 会这样工作」,模型却回答「它不应该这样,我帮你改成 Z」并直接开始改动。用户真正想要的是解释而非修改,这种「过度勤快」正损害对话体验。
来源:AGI Hunt · agihunt.info