AGI Hunt· davidbau·· 4 小时前AI 评分41
David Bau 推荐「对比内省」实验:揭示 LLM 自述机制,读神经元或可测谎
对比内省实验揭示 LLM 自述机制,读神经元或可测谎
AI 导读
David Bau 推荐 diatkinson 等人的新论文,认为「对比内省」实验平台揭示了大规模语言模型为何工作得如此好,并暗示一条谎言检测路径。同一个 AI 说「我认为 X」时,有时给出深刻准确的洞见,有时只是随机鹦鹉式撒谎;读取内部神经元活动或能分辨两者。
来源:AGI Hunt · agihunt.info