热点事件持续更新
顶级AI模型不搜索答事实题错误率约四分之一
1 篇报道1 个报道来源57 分钟前更新
先了解这件事
AI 综述
2026年9月30日,AGI Hunt 报道称,基于 Artificial Analysis 的 AA-Omniscience 基准,Randall Olson 发布的图表显示:在覆盖 42 个工作领域的 6000 道具体事实题中,不开启搜索时,顶级 AI 模型约四分之一的答案出错。报道由此得出结论,涉及重要事实时用户仍需谨慎核验模型输出,不能完全依赖模型记忆。目前该事件仅有这一项披露,尚无模型厂商回应,也没有其他机构的独立复现或对错误率口径的进一步说明。
AI 根据报道生成 · 33 分钟前更新
最新进展9月30日 22:06
新基准披露顶级AI模型不搜索答事实题约四分之一出错,报道提醒重要事实仍需人工核验。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- AGI HuntArtificial Analysis AA-Omniscience 基准:顶级 AI 模型不搜索答事实题约四分之一出错
基于 Artificial Analysis 的 AA-Omniscience 基准,Randall Olson 发布的图表显示,在 42 个工作领域的 6000 道具体事实题中,不开启搜索时顶级 AI 模型约四分之一的答案出错。结论是涉及重要事实时,用户仍需谨慎核验模型输出,不能完全依赖模型记忆。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。