跳到正文
原文
AGI Hunt· sanmikoyejo·· 1 天前AI 评分43

研究:同类安全基准相关性弱,偏差定义各行其是

AI 导读

研究发现,声称测量相似安全概念的 AI 基准之间相关性往往很弱,「偏差」等安全概念在各基准中的概念化方式不一致,跨基准的安全结论难以直接比较。研究提出用聚敛与区分效度系统评估 AI 基准有效性,并指出偏差基准 BBQ 可能实际在测推理、偏差基准按任务形式聚簇而非宣称的性别种族偏差。53 个模型、56 项基准的逐题输出数据集已公开发布。

来源:AGI Hunt · agihunt.info