跳到正文
原文
AGI Hunt· Michael_D_Moor·· 12 小时前AI 评分55

ICML 论文:上调采样对齐话语,LLM 不对齐率从 45% 降到 9%

ICML 论文:对齐话语上调采样,LLM 不对齐率从 45% 降到 9%

AI 导读

ICML 2026 论文《Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment》用受控实验发现,预训练语料中关于 AI 的话语会因果影响下游对齐表现。

来源:AGI Hunt · agihunt.info