跳到正文
原文
AGI Hunt· michael201110·· 4 小时前AI 评分38

14 岁作者用强化学习训练 AI 玩 PolyTrack 赛车,揭示极端闭环敏感性

AI 导读

14 岁作者开源强化学习项目 PolyBot,训练 AI 在赛车游戏 PolyTrack 中驾驶,先后尝试 TQC、PPO 与 GRTQC。TQC 策略单圈 24.263 秒,仅加 +0.0001 持续转向偏移即在约 56% 赛道失败,纵向 ±0.0001 扰动也能在 24% 进度前致败。项目代码已在 GitHub(michael201110/poly-bot)开源。

来源:AGI Hunt · agihunt.info