跳到正文
原文
AGI Hunt· lateinteraction·· 4 小时前AI 评分40

CMU 等推出 ScholarCatalyst 基准,评测 AI 能否提出好研究问题

CMU 等推出 ScholarCatalyst 基准测 AI 提问能力

AI 导读

CMU、华盛顿大学等团队(含 Chelsea Finn、Yejin Choi)发布 ScholarCatalyst 基准,用于评测 AI 能否像科学家一样提出高质量研究问题。该基准用 184 位作者标注量化研究者的「研究品味」,指向「定义一个好研究问题」仍依赖人类这一现状。实验发现,agentic 搜索表现不敌嵌入检索。

来源:AGI Hunt · agihunt.info