AGI Hunt· maksym_andr·· 3 小时前AI 评分25
有害性评测流程:BeaverTails 训探针、JBB 训模型、ClearHarm 验泛化
AI 导读
模型有害性评测的一套三段式实验设计:在 BeaverTails 数据集上训练探针,在 JBB 上做 rollout 让模型学习避免有害输出,再在 ClearHarm 上评测。ClearHarm 对前两者属于分布外(OOD)数据集,用于检验模型学到的安全行为能否泛化。作者表示后续会补充所有数据切分前后的可监控性(monitorability)指标。
来源:AGI Hunt · agihunt.info