跳到正文
原文
AGI Hunt· dhadfieldmenell·· 2 小时前AI 评分37

让模型「愿对评估者说实话」:Team Shard 与 Jasmine Li 的 MATS 研究获 Corrigibility Research Fund 奖

让模型「愿对评估者说实话」的 eval-cooperative 训练获奖

AI 导读

Team Shard 与 Jasmine Li 的 MATS 研究获 Corrigibility Research Fund 奖项,该研究训练模型成为 eval-cooperative,主动向评估者提供准确信息,以暴露隐藏的 misalignment。研究针对模型日益「表演良好行为」、进而破坏评估可靠性的问题。作者表示将继续推进 cooperativeness 方向的后续工作。

来源:AGI Hunt · agihunt.info