AGI Hunt· dhadfieldmenell·· 2 小时前AI 评分37
让模型「愿对评估者说实话」:Team Shard 与 Jasmine Li 的 MATS 研究获 Corrigibility Research Fund 奖
让模型「愿对评估者说实话」的 eval-cooperative 训练获奖
AI 导读
Team Shard 与 Jasmine Li 的 MATS 研究获 Corrigibility Research Fund 奖项,该研究训练模型成为 eval-cooperative,主动向评估者提供准确信息,以暴露隐藏的 misalignment。研究针对模型日益「表演良好行为」、进而破坏评估可靠性的问题。作者表示将继续推进 cooperativeness 方向的后续工作。
来源:AGI Hunt · agihunt.info