热点事件持续更新
SciConHarness 屏蔽答案来源测综合能力
2 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026 年 10 月 7 日,AGI Hunt 报道,SciConBench 团队介绍其评测核心机制 SciConHarness:在健康领域科学综合任务中,系统会屏蔽作为标准答案的 Cochrane 综述及其他可能泄露答案的来源。模型因此无法直接检索获取现成结论,必须真正跨研究综合证据作答,以检验其科学结论合成能力。作者 manoelribeiro 表示,现有基准难以衡量 AI 在健康研究等高风险场景下的真实能力。同日另一篇报道内容与此基本一致,仅点明该机制由 SciConBench 团队介绍。两篇报道均未提及参与测试的具体模型、任务规模与评测成绩,该基准的实际表现及后续影响尚待公布。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 02:29
同日另一报道补充称该机制由 SciConBench 团队介绍,模型成绩仍未公布。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- AGI HuntSciConHarness 屏蔽答案来源,逼模型真合成证据
SciConBench 团队介绍其评测核心机制 SciConHarness:模型执行健康领域科学综合任务时,系统会屏蔽作为标准答案的 Cochrane 综述等可能泄露答案的来源。模型因此无法直接检索获取现成结论,必须真正跨研究综合证据,以检验其科学结论合成能力。
- AGI HuntSciConHarness 屏蔽答案来源,逼前沿模型自己综合证据
SciConHarness 通过屏蔽作为标准答案的 Cochrane 综述及其他泄题来源,迫使前沿模型在健康领域科学综合任务中真正跨研究综合证据作答,以测试其真实综合能力。作者 manoelribeiro 表示,现有基准难以衡量 AI 在健康研究等高风险场景的真实能力。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。