跳到正文
热点事件持续更新

Gerard Sans:对齐沦为「安全洗白」

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026 年 10 月 6 日,ML 研究者 Gerard Sans 公开批评 AI 实验室把对齐做成了「安全洗白」,认为它只是给实验室提供一条表面重视安全的出路,而非真正关心安全。他提出的理由是:实验室若真正解释技术原理与局限性,产品就会失去商业吸引力,因此不会这么做。他指出,系统的可靠实际需要 harness、上百次迭代和层层校验,而不是靠对齐说法来保证。这一落差直接体现在用户体验上——用户困惑于指令被忽略、模型跑偏等问题。Sans 以「你只能骗人一时」概括其判断,认为这种表面化的安全姿态难以长期维持。截至该报道,事件仅为其单方面的公开批评,尚无相关 AI 实验室的回应。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. AGI Hunt
    Gerard Sans 批评对齐形同「安全洗白」,称 AI 实验室未真正关心安全

    ML 研究者 Gerard Sans 批评 AI 实验室把对齐做成「安全洗白」,只是给实验室一条表面重视安全的出路。他表示实验室若真正解释技术原理与局限性,产品就会失去商业吸引力,而系统可靠实际需要 harness、上百次迭代和层层校验。由此用户困惑于指令被忽略、模型跑偏,他称「你只能骗人一时」。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。