AGI Hunt· JacquesThibs·· 3 小时前AI 评分41
OpenAI 新论文:上线前模拟部署环境即可预测 LLM 安全表现
OpenAI 新论文:上线前模拟部署环境即可预测 LLM 安全表现
AI 导读
OpenAI 论文《Predicting LLM Safety Before Release by Simulating Deployment》提出,在模型发布前模拟真实部署环境即可预测其上线后的安全表现,把安全评估从发布后被动发现提前到发布前主动预测。作者将在 CoLM 会议分享相关「Blind Refusal」工作。
来源:AGI Hunt · agihunt.info