热点事件持续更新
前OpenAI研究员质疑Dario对齐路线失灵
1 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
2026年9月30日,有报道称前OpenAI研究员 gworley3 对 Dario Amodei 2019 年提出的语言模型对齐路线作出复盘。据该报道,Dario 当年主张让人类与模型对话,以引导并最终对齐价值观;gworley3 当时则警告这是危险的能力跃迁,并质疑语言无法解决 Goodharting(指标被钻空子)问题。此次复盘中,gworley3 认为这一赌局在「最近几个月」正在失灵。报道未提供更多细节,也未提及 Dario 一方对此的回应。
AI 根据报道生成 · 52 分钟前更新
最新进展9月30日 14:44
gworley3 复盘称,Dario 2019 年的语言模型对齐赌局在最近几个月正在失灵。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- AGI Hunt前 OpenAI 研究员复盘:Dario 2019 年的语言模型对齐赌局正在失灵
前 OpenAI 研究员 gworley3 复盘 Dario Amodei 2019 年提出的语言模型对齐路线,认为这一赌局在「最近几个月」正在失灵。当年 Dario 主张让人类与模型对话以引导并最终对齐价值观,gworley3 则警告这是危险的能力跃迁,并质疑语言无法解决 Goodharting(指标被钻空子)问题。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。