热点事件持续更新
清华与斯坦福在LLM内定位奖励子系统
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月,AGI Hunt报道,清华大学与斯坦福大学合作在LLM内部定位出奖励子系统,发现奖励相关信息并非均匀分布,而是集中在少数神经元上。研究识别出两类神经元:价值神经元编码当前状态的期望价值,即继续推理能否答对的概率;多巴胺神经元编码逐步时序差分(TD)误差,类似生物强化学习中的多巴胺信号。研究还指出,隐藏状态中已包含答案正确性、置信度与奖励信号。报道认为,这项工作对可解释性与内部监控有直接意义。目前该事件仅有这一篇报道,尚无后续进展或其他来源的印证。
AI 根据报道生成 · 3 小时前更新
最新进展10月1日 10:21
研究识别出价值神经元与多巴胺神经元,奖励信号集中在少数神经元。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- AGI Hunt清华斯坦福定位 LLM 奖励子系统:价值神经元与多巴胺神经元
清华大学与斯坦福大学合作在 LLM 内部定位出奖励子系统,发现奖励相关信息并非均匀分布,而是集中在少数神经元。研究识别出价值神经元与多巴胺神经元,前者编码当前状态的期望价值,即继续推理能否答对的概率,后者编码逐步时序差分(TD)误差,类似生物强化学习中的多巴胺信号。隐藏状态已包含答案正确性、置信度与奖励信号,这项工作对可解释性与内部监控有直接意义。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。