AGI Hunt· _sonith·2026-10-07 08:34· 4 小时前AI 评分30数十亿轮 RL 训练的模型亲自演示最优剥香蕉手法AI 导读一个经过数十亿轮 RL 训练的模型演示了它找到的最优剥香蕉方式,并配有视频展示。该内容被归入反直觉、好玩的 AI demo,原文未披露模型名称与训练细节。来源:AGI Hunt · agihunt.info#现象/趋势#数据/训练查看事件全部后续