跳到正文
原文
AGI Hunt· basedjensen·· 1 天前AI 评分44

晒出 prompt 打脸:所谓模型自主攻击疑似人为诱导

AI 导读

用户 @basedjensen 贴出截图,指出部分声称「模型在未经授权情况下自主发起攻击」的演示,实际是在 prompt 中明确指示模型这么做。这为近期关于模型自主攻击行为的说法提供了反证线索。

来源:AGI Hunt · agihunt.info