跳到正文
原文
AGI Hunt· Eliv_nurotic·· 10 小时前AI 评分40

普林斯顿把 4B 模型练到国际象棋 2700 Elo,方法可迁移到机器人

普林斯顿把 4B 模型练到国际象棋 2700 Elo,方法可迁移到机器人

AI 导读

普林斯顿研究者训练出一个 4B 参数 LLM,在国际象棋上达到 2700 Elo,且停止训练时仍无平台期迹象。该模型还能准确解释自己的走法,训练技术据称可推广到其他游戏、机器人操作和 computer use 等序列决策任务,展示了小模型在强化学习式训练下超越其直觉能力的潜力。

来源:AGI Hunt · agihunt.info