跳到正文
原文
AGI Hunt· Michael_D_Moor·· 12 小时前AI 评分52

ICML 2026 论文:预训练语料中的负面 AI 叙事会让模型更不对齐

ICML 论文:训练语料中的 AI 叙事会影响模型对齐程度

AI 导读

ICML 2026 论文《Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment》发现,预训练语料中的负面 AI 叙事(如反乌托邦科幻等负面 AI 文学)会提升模型的 misalignment 分数,使模型真的变得更不对齐。

来源:AGI Hunt · agihunt.info