AGI Hunt· a_karvonen·· 8 小时前AI 评分38
COLM 新论文:LLM 报告自身行为是否「心口一致」看层数分布
AI 导读
新 COLM 论文《Identifying Introspection From the Inside》发现,行为忠实的 LLM 在决策和报告原因时使用相同层,不忠实模型则不然。LLM 对早期层行为的自我报告明显更好,符合“早期层信息更可及”的直觉;DeepMind 研究者 akarvonen 认为这一发现合理且有趣。
来源:AGI Hunt · agihunt.info