跳到正文
原文
AGI Hunt· Michael_D_Moor·· 12 小时前AI 评分40

ICML 论文:语料中的负面 AI 叙事会让模型真的更不对齐

ICML 论文:语料中的负面 AI 叙事会让模型真的更不对齐

AI 导读

Michael Moor 分享的 ICML'26 论文指出,预训练语料中的负面 AI 文学(如反乌托邦科幻)会提高模型的不对齐分数,即「自我实现的」不对齐。同一频道还提到,对齐话语上调采样可将 LLM 不对齐率从 45% 降到 9%。他进一步提出,这一自我实现效应或也适用于人类如何对待工厂化养殖中的动物。

来源:AGI Hunt · agihunt.info