跳到正文
原文
AGI Hunt· StanfordHAI·· 10 小时前AI 评分44

斯坦福 HAI 两研究:给 AI 打分的基准测试可能测错了东西

斯坦福两研究:给 AI 打分的基准测试可能测错了东西

AI 导读

斯坦福 HAI 支持的两项研究指出,给 AI 推理、安全、偏见打分的基准测试可能并未测到其声称要测的东西,核心是基准的构念效度。论文将亮相 10 月旧金山第三届 COLM 会议,作者 Sanmi Koyejo 与 Sang Truong 呼吁以更高严肃性构建基准,因为基准分数已影响数十亿美元投资、监管与政府采购决策。

来源:AGI Hunt · agihunt.info