跳到正文
热点事件持续更新

CMU等发布ScholarCatalyst提问基准

3 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月2日,AGI Hunt 报道,CMU、华盛顿大学等团队(参与者包括 Chelsea Finn、Yejin Choi)发布 ScholarCatalyst 基准,用于评测 AI 能否像科学家一样从海量文献中找出推进研究项目所需的前期想法,并量化研究者的「研究品味」。据同日后续报道,该基准由 207 篇近期计算机科学论文的 184 位第一作者标注哪些候选论文推进了各自项目,检索范围仅限项目开始时已可获得的文献;实验发现 agentic 搜索的表现不敌嵌入检索。发布者称,该基准度量的是「AI 能解决给定问题」之外更难的一环:AI 虽已在 Navier-Stokes 等开放问题上取得进展,但定义一个全新的问题仍依赖人类的研究品味。早先报道仅称基准素材来自 AI 研究者对自己「什么灵感催生了这项工作」的第一手叙述,未披露题目规模与评测方式;后续报道补充为 207 篇论文、184 位作者标注,并明确检索限于项目开始时可得的文献。

AI 根据报道生成 · 3 小时前更新

事件进展

2 个进展
  1. 10月2日 23:00 · 1 篇报道
    CMU等发布ScholarCatalyst检索基准
    AGI Hunt:ScholarCatalyst:科学家找灵感论文的新基准,agentic 搜索不敌嵌入检索
  2. 10月2日 22:56 · 2 篇报道
    CMU等推出ScholarCatalyst基准测AI提问能力
    AGI Hunt:ScholarCatalyst 基准:测 AI 能否像人一样提出好研究问题

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AGI Hunt
    CMU 等推出 ScholarCatalyst 基准,评测 AI 能否提出好研究问题

    CMU、华盛顿大学等团队(含 Chelsea Finn、Yejin Choi)发布 ScholarCatalyst 基准,用于评测 AI 能否像科学家一样提出高质量研究问题。该基准用 184 位作者标注量化研究者的「研究品味」,指向「定义一个好研究问题」仍依赖人类这一现状。实验发现,agentic 搜索表现不敌嵌入检索。

  2. AGI Hunt
    ScholarCatalyst:科学家找灵感论文的新基准,agentic 搜索不敌嵌入检索

    CMU/UW 等团队发布 ScholarCatalyst 基准,评测 AI 能否从海量文献中找出科学家所需的前期想法。基准由 207 篇近期 CS 论文的 184 位一作标注哪些候选论文推进了项目,检索仅限项目开始时可得的文献。

  3. AGI Hunt
    ScholarCatalyst 基准:测 AI 能否像人一样提出好研究问题

    研究者推出 ScholarCatalyst 基准,用于评测 AI 能否复现人类提出研究问题的品味与判断。该基准素材来自 AI 研究者对自己「什么灵感催生了这项工作」的第一手叙述;发布者称这是对「AI 能解决给定问题」之外更难一环的度量——AI 虽已在 Navier-Stokes 等开放问题上取得进展,但定义一个新问题仍依赖人类的研究品味。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。