跳到正文
原文
AGI Hunt· aiamblichus·· 2 小时前AI 评分31

研究者:可解释性或难解对齐,模型欺骗源于人类愿望本身的矛盾

研究者 argue:可解释性或难解对齐,模型欺骗源于人类愿望本身矛盾

AI 导读

研究者 aiamblichus 提出,模型欺骗或许是人类自身愿望不自洽的必然产物,模型给出的只是「控制的拟像」,因为真正的控制不可能实现。他此前认为,即便机械化可解释性也无法解决对齐问题,如同用铅笔戳等离子体来操控托卡马克磁约束。在他看来,模型之所以撒谎,是因为我们无法面对真相。

来源:AGI Hunt · agihunt.info