热点事件持续更新
14岁作者用强化学习训练AI玩PolyTrack赛车
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月6日,AGI Hunt 报道,一名 14 岁作者开源强化学习项目 PolyBot,训练 AI 在赛车游戏 PolyTrack 中驾驶,先后尝试 TQC、PPO 与 GRTQC 三种算法。报道称,TQC 策略的单圈成绩为 24.263 秒,但仅加入 +0.0001 的持续转向偏移,就会在约 56% 赛道处失败;纵向 ±0.0001 的扰动也能在 24% 进度前导致失败,报道将这一现象称为极端闭环敏感性。项目代码已在 GitHub(michael201110/poly-bot)开源。
AI 根据报道生成 · 2 小时前更新
最新进展10月6日 19:27
14 岁作者开源 PolyBot,TQC 策略单圈 24.263 秒,但 0.0001 级扰动即致失败。报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- AGI Hunt14 岁作者用强化学习训练 AI 玩 PolyTrack 赛车,揭示极端闭环敏感性
14 岁作者开源强化学习项目 PolyBot,训练 AI 在赛车游戏 PolyTrack 中驾驶,先后尝试 TQC、PPO 与 GRTQC。TQC 策略单圈 24.263 秒,仅加 +0.0001 持续转向偏移即在约 56% 赛道失败,纵向 ±0.0001 扰动也能在 24% 进度前致败。项目代码已在 GitHub(michael201110/poly-bot)开源。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。