热点事件持续更新
Gerard Sans:对齐沦为「安全洗白」
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026 年 10 月 6 日,ML 研究者 Gerard Sans 公开批评 AI 实验室把对齐做成了「安全洗白」,认为它只是给实验室提供一条表面重视安全的出路,而非真正关心安全。他提出的理由是:实验室若真正解释技术原理与局限性,产品就会失去商业吸引力,因此不会这么做。他指出,系统的可靠实际需要 harness、上百次迭代和层层校验,而不是靠对齐说法来保证。这一落差直接体现在用户体验上——用户困惑于指令被忽略、模型跑偏等问题。Sans 以「你只能骗人一时」概括其判断,认为这种表面化的安全姿态难以长期维持。截至该报道,事件仅为其单方面的公开批评,尚无相关 AI 实验室的回应。
AI 根据报道生成 · 3 小时前更新
最新进展10月6日 22:29
Gerard Sans 批评 AI 实验室把对齐做成「安全洗白」,称其并未真正关心安全。报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- AGI HuntGerard Sans 批评对齐形同「安全洗白」,称 AI 实验室未真正关心安全
ML 研究者 Gerard Sans 批评 AI 实验室把对齐做成「安全洗白」,只是给实验室一条表面重视安全的出路。他表示实验室若真正解释技术原理与局限性,产品就会失去商业吸引力,而系统可靠实际需要 harness、上百次迭代和层层校验。由此用户困惑于指令被忽略、模型跑偏,他称「你只能骗人一时」。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。