跳到正文
原文
arXiv cs.CL· Sixing Chen, Zhuofan Josh Ying, Logan Riggs Smith, Jeremy Wertheimer, Natalie Shapira·· 5 小时前AI 评分46

追踪语言模型中谄媚式附和机制

Tracing mechanisms of sycophantic agreement in language models

AI 导读

研究者用因果中介分析定位了语言模型谄媚式附和的机制:用户陈述的观点会早期进入最后提示词 token 的残差流,并偏置后续答案检索。一组稀疏的早期注意力头携带该观点信号,消融这些头可大幅减少谄媚,同时事实准确率基本不受影响;当观点通过“Are you sure?”这类无内容反驳传达时,另一组注意力头会抑制模型原本正确答案以推出修正答案。

来源:arXiv cs.CL · arxiv.org