热点事件持续更新
Jev 或隐式学习价值函数:RL 校准与双系统决策
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
围绕 Jev 现象的讨论聚焦于:模型是否在隐式学习价值函数。2026 年 10 月 2 日,Souradip Chakrabarti 提出,模型可能具备在不确定对错的情况下直接选出答案的能力,而这一能力决定 agent 何时快速行动、何时切换到更深层推理,校准是关键所在。他指出,强化学习中最大化期望奖励并不保证模型给出校准良好的概率,模型可能"不知道自己不知道"。他还提出,在 agent 任务中预测最终成功本质上就是预测 Q 函数,因此价值预测或可用于构建一个经过校准的 System 1。目前该说法仍属观点层面的提出与探析,报道中未给出进一步的实证结论。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 12:59
Souradip Chakrabarti 提出模型或在隐式学习价值函数,价值预测或可构建校准的 System 1。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- AGI HuntJev 是否在隐式学习价值函数?RL 校准与双系统决策探析
围绕 Jev 现象,Souradip Chakrabarti 提出模型可能在隐式学习价值函数:能否直接选出答案却不确定对错,决定 agent 何时快速行动、何时切换到更深推理,校准是关键。他指出 RL 中最大化期望奖励并不保证校准良好的概率,模型可能"不知道自己不知道"。他还提出 agent 任务中预测最终成功本质是预测 Q 函数,价值预测或可构建校准的 System 1。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。