AGI Hunt· StanfordHAI·· 10 小时前AI 评分44
斯坦福 HAI 两研究:给 AI 打分的基准测试可能测错了东西
斯坦福两研究:给 AI 打分的基准测试可能测错了东西
AI 导读
斯坦福 HAI 支持的两项研究指出,给 AI 推理、安全、偏见打分的基准测试可能并未测到其声称要测的东西,核心是基准的构念效度。论文将亮相 10 月旧金山第三届 COLM 会议,作者 Sanmi Koyejo 与 Sang Truong 呼吁以更高严肃性构建基准,因为基准分数已影响数十亿美元投资、监管与政府采购决策。
来源:AGI Hunt · agihunt.info