跳到正文
原文
AGI Hunt· lateinteraction·· 4 小时前AI 评分34

Jev 是否在隐式学习价值函数?RL 校准与双系统决策探析

AI 导读

围绕 Jev 现象,Souradip Chakrabarti 提出模型可能在隐式学习价值函数:能否直接选出答案却不确定对错,决定 agent 何时快速行动、何时切换到更深推理,校准是关键。他指出 RL 中最大化期望奖励并不保证校准良好的概率,模型可能"不知道自己不知道"。他还提出 agent 任务中预测最终成功本质是预测 Q 函数,价值预测或可构建校准的 System 1。

来源:AGI Hunt · agihunt.info