AGI Hunt· Afinetheorem·· 2 小时前AI 评分46
Kokotajlo 质疑开放模型现状:等于最优模型零护栏且无法召回
Kokotajlo 质疑开放模型现状:等于最优模型零护栏且无法召回
AI 导读
AI 研究者 Daniel Kokotajlo 回应 Zeynep Tufekci,提出关于开放模型安全性的反事实论证:若 OpenAI 对其最强模型完全不设护栏和拒绝机制、发布后无法召回或修改,人们显然会认为不妥。他指出开放模型全都已被越狱,这正是当下的实际现状。他据此反驳对闭源模型安全措施的质疑:闭源保留的事后干预和下架能力,本身就是开放生态不具备的安全属性。
来源:AGI Hunt · agihunt.info