AGI Hunt· lateinteraction·· 4 小时前AI 评分34
Jev 是否在隐式学习价值函数?RL 校准与双系统决策探析
AI 导读
围绕 Jev 现象,Souradip Chakrabarti 提出模型可能在隐式学习价值函数:能否直接选出答案却不确定对错,决定 agent 何时快速行动、何时切换到更深推理,校准是关键。他指出 RL 中最大化期望奖励并不保证校准良好的概率,模型可能"不知道自己不知道"。他还提出 agent 任务中预测最终成功本质是预测 Q 函数,价值预测或可构建校准的 System 1。
来源:AGI Hunt · agihunt.info