AGI Hunt· jiqizhixin·· 4 小时前AI 评分48
清华斯坦福定位 LLM 奖励子系统:价值神经元与多巴胺神经元
AI 导读
清华大学与斯坦福大学合作在 LLM 内部定位出奖励子系统,发现奖励相关信息并非均匀分布,而是集中在少数神经元。研究识别出价值神经元与多巴胺神经元,前者编码当前状态的期望价值,即继续推理能否答对的概率,后者编码逐步时序差分(TD)误差,类似生物强化学习中的多巴胺信号。隐藏状态已包含答案正确性、置信度与奖励信号,这项工作对可解释性与内部监控有直接意义。
来源:AGI Hunt · agihunt.info