跳到正文
原文
AGI Hunt· MariusHobbhahn·· 2 小时前AI 评分42

Apollo Research 提出安全案例四主张:如何证明模型不在暗中作乱

Apollo Research 提出安全案例四主张:如何证明模型不在暗中作乱

AI 导读

Apollo Research 发布新文章,提出要安全开发前沿 AI,开发者必须能证明模型不会 "scheming",即暗中违背开发者意图追求非预期目标。文章给出任何一份 scheming 安全论证(safety case)必须作出的四个具体主张,以及嵌入式评估人员为验证这些主张所需的资源与访问权限。MariusHobbhahn 补充了其想评估的具体安全主张及所需访问级别的更多细节。

来源:AGI Hunt · agihunt.info