AGI Hunt· davidbau·2026-10-06 17:12· 4 小时前AI 评分62David Bau 实验室首次诱导并观测 LLM 忠实内省的神经足迹实验室新实验首次诱导并观测 LLM 忠实内省的神经足迹AI 导读David Bau 实验室基于 Self-Interpretability 协议(arXiv:2505.17120),用 SFT 训练 Qwen3-32B 扮演 100 个带随机隐藏偏好的角色,首次在开源模型上诱导并观测到忠实的自我报告。来源:AGI Hunt · agihunt.info#论文/研究#数据/训练#arXiv查看事件全部后续