跳到正文
热点事件持续更新

研究者争论开放权重模型安全监管不对称

2 篇报道1 个报道来源1 小时前更新

先了解这件事

AI 综述

AI 研究者就开放权重模型的安全监管标准展开争论。研究者 Afinetheorem 与 Zeynep Tufekci 质疑存在双重标准:封闭模型发布前需经数月测试,而开放模型仅靠「事后防御」;他们反问,如果 OpenAI 最好的模型完全没有护栏或拒绝机制、发布后也无法下架或修改护栏,这会不会是好主意,并指出开放模型早已全部被越狱。随后,研究者 Daniel Kokotajlo 回应 Zeynep Tufekci,提出反事实论证:若 OpenAI 对其最强模型完全不设护栏和拒绝机制、发布后无法召回或修改,人们显然会认为不妥,而开放模型全都已被越狱正是当下的实际现状。他据此反驳对闭源模型安全措施的质疑,称闭源保留的事后干预和下架能力,本身就是开放生态不具备的安全属性。争论焦点仍在于监管要求对开放与封闭模型是否不对称。

AI 根据报道生成 · 55 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. AGI Hunt
    AI 研究者质问:开源模型全被越狱,OpenAI 零护栏也能接受吗?

    研究者 Afinetheorem 与 Zeynep Tufekci 就开放模型监管展开争论,质疑封闭模型需数月事前测试、而开放模型仅靠「事后防御」的双重标准。他们反问:如果 OpenAI 最好的模型完全没有护栏或拒绝机制、发布后也无法下架或修改护栏,这会是好主意吗?而开放模型早已全部被越狱。

  2. AGI Hunt
    Kokotajlo 质疑开放模型现状:等于最优模型零护栏且无法召回

    AI 研究者 Daniel Kokotajlo 回应 Zeynep Tufekci,提出关于开放模型安全性的反事实论证:若 OpenAI 对其最强模型完全不设护栏和拒绝机制、发布后无法召回或修改,人们显然会认为不妥。他指出开放模型全都已被越狱,这正是当下的实际现状。他据此反驳对闭源模型安全措施的质疑:闭源保留的事后干预和下架能力,本身就是开放生态不具备的安全属性。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。