跳到正文
热点事件持续更新

SciConHarness 屏蔽答案来源测综合能力

2 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 7 日,AGI Hunt 报道,SciConBench 团队介绍其评测核心机制 SciConHarness:在健康领域科学综合任务中,系统会屏蔽作为标准答案的 Cochrane 综述及其他可能泄露答案的来源。模型因此无法直接检索获取现成结论,必须真正跨研究综合证据作答,以检验其科学结论合成能力。作者 manoelribeiro 表示,现有基准难以衡量 AI 在健康研究等高风险场景下的真实能力。同日另一篇报道内容与此基本一致,仅点明该机制由 SciConBench 团队介绍。两篇报道均未提及参与测试的具体模型、任务规模与评测成绩,该基准的实际表现及后续影响尚待公布。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    SciConHarness 屏蔽答案来源,逼模型真合成证据

    SciConBench 团队介绍其评测核心机制 SciConHarness:模型执行健康领域科学综合任务时,系统会屏蔽作为标准答案的 Cochrane 综述等可能泄露答案的来源。模型因此无法直接检索获取现成结论,必须真正跨研究综合证据,以检验其科学结论合成能力。

  2. AGI Hunt
    SciConHarness 屏蔽答案来源,逼前沿模型自己综合证据

    SciConHarness 通过屏蔽作为标准答案的 Cochrane 综述及其他泄题来源,迫使前沿模型在健康领域科学综合任务中真正跨研究综合证据作答,以测试其真实综合能力。作者 manoelribeiro 表示,现有基准难以衡量 AI 在健康研究等高风险场景的真实能力。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。