跳到正文
热点事件持续更新

有害性评测三段式流程与 ClearHarm 泛化检验

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月3日,AGI Hunt 报道了一套模型有害性评测的三段式实验设计。该流程分三步推进:先在 BeaverTails 数据集上训练探针,再在 JBB 上做 rollout,让模型学习避免有害输出,最后在 ClearHarm 上评测。报道指出,ClearHarm 相对前两个数据集属于分布外(OOD)数据集,这一环节被用来检验模型学到的安全行为能否泛化到未见分布。作者同时表示,后续会补充所有数据切分前后的可监控性(monitorability)指标。目前公开信息仅涉及流程设计本身,尚未给出具体评测结果或数值。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. AGI Hunt
    有害性评测流程:BeaverTails 训探针、JBB 训模型、ClearHarm 验泛化

    模型有害性评测的一套三段式实验设计:在 BeaverTails 数据集上训练探针,在 JBB 上做 rollout 让模型学习避免有害输出,再在 ClearHarm 上评测。ClearHarm 对前两者属于分布外(OOD)数据集,用于检验模型学到的安全行为能否泛化。作者表示后续会补充所有数据切分前后的可监控性(monitorability)指标。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。