AGI Hunt· micoolcho·2026-10-08 00:02· 4 小时前AI 评分50MIT 提出 SOLE-R1:视频语言推理充当唯一奖励,机器人零样本在线学技能AI 导读MIT 与 RAI Institute 发布 SOLE-R1,一个充当在线 RL 唯一奖励信号的视频语言推理模型,代码、模型、数据均已开源。它仅凭原始视频和自然语言目标做时空链式推理(CoT),输出稠密的任务进度估计直接作为奖励,训练采用 SFT + 可验证奖励 RL 的混合框架。来源:AGI Hunt · agihunt.info#论文/研究#具身智能#推理#开源/仓库#多模态查看事件全部后续