热点事件持续更新
研究者争论开放权重模型安全监管不对称
2 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
AI 研究者就开放权重模型的安全监管标准展开争论。研究者 Afinetheorem 与 Zeynep Tufekci 质疑存在双重标准:封闭模型发布前需经数月测试,而开放模型仅靠「事后防御」;他们反问,如果 OpenAI 最好的模型完全没有护栏或拒绝机制、发布后也无法下架或修改护栏,这会不会是好主意,并指出开放模型早已全部被越狱。随后,研究者 Daniel Kokotajlo 回应 Zeynep Tufekci,提出反事实论证:若 OpenAI 对其最强模型完全不设护栏和拒绝机制、发布后无法召回或修改,人们显然会认为不妥,而开放模型全都已被越狱正是当下的实际现状。他据此反驳对闭源模型安全措施的质疑,称闭源保留的事后干预和下架能力,本身就是开放生态不具备的安全属性。争论焦点仍在于监管要求对开放与封闭模型是否不对称。
AI 根据报道生成 · 55 分钟前更新
最新进展10月1日 00:19
Kokotajlo 回应称,闭源保留的事后干预与下架能力正是开放生态不具备的安全属性。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- AGI HuntAI 研究者质问:开源模型全被越狱,OpenAI 零护栏也能接受吗?
研究者 Afinetheorem 与 Zeynep Tufekci 就开放模型监管展开争论,质疑封闭模型需数月事前测试、而开放模型仅靠「事后防御」的双重标准。他们反问:如果 OpenAI 最好的模型完全没有护栏或拒绝机制、发布后也无法下架或修改护栏,这会是好主意吗?而开放模型早已全部被越狱。
- AGI HuntKokotajlo 质疑开放模型现状:等于最优模型零护栏且无法召回
AI 研究者 Daniel Kokotajlo 回应 Zeynep Tufekci,提出关于开放模型安全性的反事实论证:若 OpenAI 对其最强模型完全不设护栏和拒绝机制、发布后无法召回或修改,人们显然会认为不妥。他指出开放模型全都已被越狱,这正是当下的实际现状。他据此反驳对闭源模型安全措施的质疑:闭源保留的事后干预和下架能力,本身就是开放生态不具备的安全属性。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。