AGI Hunt· QuintinPope5·· 1 天前AI 评分36
对齐研究者 Quintin Pope 质疑灾难性遗忘能否抹除 LLM 后门坏行为
研究者质疑灾难性遗忘能否抹除LLM后门坏行为
AI 导读
对齐研究者 Quintin Pope 质疑用微调移除模型坏行为的有效性,指出 BEEAR(EMNLP 2024)这类移除 LLM 安全后门的方法本质上依赖灾难性遗忘来清除恶意行为,这或许解释了为何模型越强、坏行为反而越容易存留。他补充说,LLM 训练对数据顺序具有鲁棒性,训练出的行为可在前缀不精确重叠的情况下经受更多训练而存活,并认为训练后门类实验并不能代表「内优化器」威胁。
来源:AGI Hunt · agihunt.info