跳到正文
热点事件持续更新

顶级AI模型不搜索答事实题错误率约四分之一

1 篇报道1 个报道来源57 分钟前更新

先了解这件事

AI 综述

2026年9月30日,AGI Hunt 报道称,基于 Artificial Analysis 的 AA-Omniscience 基准,Randall Olson 发布的图表显示:在覆盖 42 个工作领域的 6000 道具体事实题中,不开启搜索时,顶级 AI 模型约四分之一的答案出错。报道由此得出结论,涉及重要事实时用户仍需谨慎核验模型输出,不能完全依赖模型记忆。目前该事件仅有这一项披露,尚无模型厂商回应,也没有其他机构的独立复现或对错误率口径的进一步说明。

AI 根据报道生成 · 33 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. AGI Hunt
    Artificial Analysis AA-Omniscience 基准:顶级 AI 模型不搜索答事实题约四分之一出错

    基于 Artificial Analysis 的 AA-Omniscience 基准,Randall Olson 发布的图表显示,在 42 个工作领域的 6000 道具体事实题中,不开启搜索时顶级 AI 模型约四分之一的答案出错。结论是涉及重要事实时,用户仍需谨慎核验模型输出,不能完全依赖模型记忆。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。