AGI Hunt· sanmikoyejo·· 1 天前AI 评分53
研究:56 个 AI 基准×53 个模型,多项基准测不出宣称的能力
研究:56 个 AI 基准×53 个模型,多项基准测不出宣称的能力
AI 导读
一项大规模研究借鉴社会科学中的聚合效度与区分效度概念,对 56 个 AI 基准和 53 个模型进行系统检验,发现部分基准并未真正度量其宣称测量的能力。研究指出基准影响 AI 的使用、治理与部署决策,结论对当前评测体系的有效性提出质疑。研究同时公开发布了 53 个模型、56 项基准的逐题输出数据集。
来源:AGI Hunt · agihunt.info