AGI Hunt· manoelribeiro·· 3 小时前AI 评分46
SciConBench:AI 合成医学结论最高九成含事实错误
AI 导读
动态基准 SciConBench 持续评测前沿模型的科学结论合成能力,结果显示 61.1% 至 90% 的 AI 合成结论至少含一处与专家撰写的 Cochrane 综述相矛盾的事实错误。表现最好的 GPT-6.1 Sol 也仅达到 41.1 factual F1,多数模型集中在约 0.30–0.33,医疗领域的结论合成仍是待解难题。
来源:AGI Hunt · agihunt.info