跳到正文
原文
arXiv cs.CL· David I. Atkinson, Dillon Plunkett, David Bau·· 4 小时前AI 评分45

从内部识别大语言模型的内省:忠实自报告的机制特征

Identifying Introspection From the Inside

AI 导读

大语言模型的忠实自我报告可从网络内部结构识别:用低秩适配器训练模型按虚构角色的隐含线性偏好做决策后,无需显式自报告监督即可涌现出准确自报告,权重消融与冻结层实验显示偏好表征随训练前移到更早层。用 attribution patching 测得忠实模型在决策与自报告任务间的归因相似度显著更高,论文发表于 COLM 2026。

来源:arXiv cs.CL · arxiv.org