跳到正文
原文
AGI Hunt· _sonith·· 4 小时前AI 评分30

数十亿轮 RL 训练的模型亲自演示最优剥香蕉手法

AI 导读

一个经过数十亿轮 RL 训练的模型演示了它找到的最优剥香蕉方式,并配有视频展示。该内容被归入反直觉、好玩的 AI demo,原文未披露模型名称与训练细节。

来源:AGI Hunt · agihunt.info