跳到正文
原文
AGI Hunt· sanmikoyejo·· 1 天前AI 评分41

将心理测量效度检验移植到 AI 基准与 IRT 逐题分析

AI 导读

研究团队将聚敛与区分效度检验适配到 AI 基准评估,并用 IRT 模型在题目层面逐题分析,实现更细粒度效度检验。结果显示,偏差基准 BBQ 可能在测推理而非偏差,偏差基准按任务形式聚簇而非宣称的性别种族偏差;推理、知识、理解类基准高度相关或测同一概念。同类安全基准相关性弱、偏差定义不一,53 个模型、56 项基准的逐题输出数据集已公开发布。

来源:AGI Hunt · agihunt.info