跳到正文
原文
AGI Hunt· micoolcho·· 4 小时前AI 评分50

MIT 提出 SOLE-R1:视频语言推理充当唯一奖励,机器人零样本在线学技能

AI 导读

MIT 与 RAI Institute 发布 SOLE-R1,一个充当在线 RL 唯一奖励信号的视频语言推理模型,代码、模型、数据均已开源。它仅凭原始视频和自然语言目标做时空链式推理(CoT),输出稠密的任务进度估计直接作为奖励,训练采用 SFT + 可验证奖励 RL 的混合框架。

来源:AGI Hunt · agihunt.info