跳到正文
原文
AGI Hunt· davidbau·· 4 小时前AI 评分62

David Bau 实验室首次诱导并观测 LLM 忠实内省的神经足迹

实验室新实验首次诱导并观测 LLM 忠实内省的神经足迹

AI 导读

David Bau 实验室基于 Self-Interpretability 协议(arXiv:2505.17120),用 SFT 训练 Qwen3-32B 扮演 100 个带随机隐藏偏好的角色,首次在开源模型上诱导并观测到忠实的自我报告。

来源:AGI Hunt · agihunt.info