跳到正文
原文
AGI Hunt· ebiyik_·· 2 小时前AI 评分31

Reward-DAgger:通用奖励模型让机器人运行时监控跨任务迁移

Reward-DAgger:通用奖励模型让机器人运行时监控跨任务迁移

AI 导读

Reward-DAgger 提出用通用奖励/进度模型(如 Robometer)做机器人部署的运行时监控,其「门控」可跨任务、跨策略迁移。现有方法依赖任务专属失败模型或与策略绑定的不确定性估计,换任务或更新策略就要重训、重标定。作者结论是通用奖励模型已好到可取代任务专属启发式,不再需要为每个任务单独决定何时请求人类纠正。

来源:AGI Hunt · agihunt.info