AGI Hunt· _reachsumit·· 1 天前AI 评分39
Dr. Free 抛弃难度奖励,用证据增益训练自进化搜索智能体
AI 导读
Dr. Free 提出首个不依赖难度奖励的自进化搜索智能体训练框架:从知识图谱采样关系链并配对相关段落,为题目赋予多跳结构,只有完整证据段落下答案的似然超过所有捷径上下文的最大似然时,题目才获得正的信息增益奖励。该奖励基于 teacher-forced 似然计算,免去 pass-rate 估计,大幅缩短 proposer 训练时间。
来源:AGI Hunt · agihunt.info