跳到正文
热点事件持续更新

14岁作者用强化学习训练AI玩PolyTrack赛车

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月6日,AGI Hunt 报道,一名 14 岁作者开源强化学习项目 PolyBot,训练 AI 在赛车游戏 PolyTrack 中驾驶,先后尝试 TQC、PPO 与 GRTQC 三种算法。报道称,TQC 策略的单圈成绩为 24.263 秒,但仅加入 +0.0001 的持续转向偏移,就会在约 56% 赛道处失败;纵向 ±0.0001 的扰动也能在 24% 进度前导致失败,报道将这一现象称为极端闭环敏感性。项目代码已在 GitHub(michael201110/poly-bot)开源。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. AGI Hunt
    14 岁作者用强化学习训练 AI 玩 PolyTrack 赛车,揭示极端闭环敏感性

    14 岁作者开源强化学习项目 PolyBot,训练 AI 在赛车游戏 PolyTrack 中驾驶,先后尝试 TQC、PPO 与 GRTQC。TQC 策略单圈 24.263 秒,仅加 +0.0001 持续转向偏移即在约 56% 赛道失败,纵向 ±0.0001 扰动也能在 24% 进度前致败。项目代码已在 GitHub(michael201110/poly-bot)开源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。