跳到正文
原文
AGI Hunt· JacquesThibs·· 3 小时前AI 评分41

OpenAI 新论文:上线前模拟部署环境即可预测 LLM 安全表现

OpenAI 新论文:上线前模拟部署环境即可预测 LLM 安全表现

AI 导读

OpenAI 论文《Predicting LLM Safety Before Release by Simulating Deployment》提出,在模型发布前模拟真实部署环境即可预测其上线后的安全表现,把安全评估从发布后被动发现提前到发布前主动预测。作者将在 CoLM 会议分享相关「Blind Refusal」工作。

来源:AGI Hunt · agihunt.info