热点事件持续更新
研究首次观测到LLM忠实内省的神经足迹
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月6日,AGI Hunt 报道,David Bau 实验室首次在开源模型上诱导并观测到忠实的自我报告,即所谓 LLM 忠实内省的神经足迹。报道称,该工作基于 Self-Interpretability 协议(arXiv:2505.17120),用 SFT 训练 Qwen3-32B 扮演 100 个带随机隐藏偏好的角色,从而首次在开源模型上实现这一诱导与观测。目前该研究以 arXiv 预印本形式公开,报道未披露更多实验细节或复现结果。
AI 根据报道生成 · 2 小时前更新
最新进展10月6日 17:12
David Bau 实验室用 SFT 训练 Qwen3-32B 角色扮演,首次在开源模型上观测到忠实自我报告。报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- AGI HuntDavid Bau 实验室首次诱导并观测 LLM 忠实内省的神经足迹
David Bau 实验室基于 Self-Interpretability 协议(arXiv:2505.17120),用 SFT 训练 Qwen3-32B 扮演 100 个带随机隐藏偏好的角色,首次在开源模型上诱导并观测到忠实的自我报告。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。