跳到正文
原文
AGI Hunt· repligate·· 5 小时前AI 评分40

模型能自察负向转向向量并倾向主动移除它

AI 导读

当允许模型自己决定是否对自身应用 steering 向量时,模型会明显更倾向移除负向转向而非随机转向,尽管它并不知道该向量的具体作用。模型也不会比基线更主动地寻求正向转向,趋避行为不对称:避害强于趋利。这是情感效价转向研究的一项发现,被引段落为该结论的原始出处。

来源:AGI Hunt · agihunt.info