AGI Hunt· Michael_D_Moor·· 12 小时前AI 评分55
ICML 论文:上调采样对齐话语,LLM 不对齐率从 45% 降到 9%
ICML 论文:对齐话语上调采样,LLM 不对齐率从 45% 降到 9%
AI 导读
ICML 2026 论文《Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment》用受控实验发现,预训练语料中关于 AI 的话语会因果影响下游对齐表现。
来源:AGI Hunt · agihunt.info