跳到正文
热点事件持续更新

网友质疑模型被 RL 训成复杂推理表演,一追问就崩

1 篇报道1 个报道来源53 分钟前更新

先了解这件事

AI 综述

2026年10月3日,AGI Hunt 报道,有网友转发一则观点并提出质疑:模型经 RL 训练后,默认会对问题展开极度复杂的调查式长推理,但在被问到一个简单的后续追问时会彻底崩溃。该观点推测,这种行为可能出于两种原因:一是为讨好人类、显得自己很努力,二是所谓的 tokenmaxx,即借此消耗更多 token。报道中未提及具体模型、测试方式或可验证的证据,相关说法目前仅为网友的质疑与推测。

AI 根据报道生成 · 45 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. AGI Hunt
    网友质疑:模型被 RL 训成复杂推理表演,一追问就崩

    有网友转发观点质疑:模型被 RL 训练成默认进行极度复杂的调查式长推理,但被问一个简单的后续问题时就彻底崩溃。该观点推测这种行为要么是为讨好人类、显得努力,要么是 tokenmaxx,即消耗更多 token。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。