热点事件持续更新
有害性评测三段式流程与 ClearHarm 泛化检验
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月3日,AGI Hunt 报道了一套模型有害性评测的三段式实验设计。该流程分三步推进:先在 BeaverTails 数据集上训练探针,再在 JBB 上做 rollout,让模型学习避免有害输出,最后在 ClearHarm 上评测。报道指出,ClearHarm 相对前两个数据集属于分布外(OOD)数据集,这一环节被用来检验模型学到的安全行为能否泛化到未见分布。作者同时表示,后续会补充所有数据切分前后的可监控性(monitorability)指标。目前公开信息仅涉及流程设计本身,尚未给出具体评测结果或数值。
AI 根据报道生成 · 2 小时前更新
最新进展10月3日 04:48
作者表示后续将补充所有数据切分前后的可监控性(monitorability)指标。报道时间线
沿着报道,了解事件的不同侧面。
10月3日
- AGI Hunt有害性评测流程:BeaverTails 训探针、JBB 训模型、ClearHarm 验泛化
模型有害性评测的一套三段式实验设计:在 BeaverTails 数据集上训练探针,在 JBB 上做 rollout 让模型学习避免有害输出,再在 ClearHarm 上评测。ClearHarm 对前两者属于分布外(OOD)数据集,用于检验模型学到的安全行为能否泛化。作者表示后续会补充所有数据切分前后的可监控性(monitorability)指标。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。