AGI Hunt· dhadfieldmenell·· 3 小时前AI 评分31
COLM 2026 新研究:用因果方法定位谄媚等弥散式模型行为
AI 导读
COLM 2026 海报 #80 上,Aruna 及合作者(含 Amir Zur、Atticus Geiger、David Hadfield-Menell)展示了用因果干预方法定位模型中弥散概念(如风格、谄媚行为)的研究。作者指出,许多定位方法依赖单 token 差异,难以处理这类分散在生成过程中的复杂行为,因果干预被视为新的方向。
来源:AGI Hunt · agihunt.info