跳到正文
原文
AGI Hunt· randal_olson·· 2 小时前AI 评分48

Artificial Analysis AA-Omniscience 基准:顶级 AI 模型不搜索答事实题约四分之一出错

数据显示顶级AI模型不搜索时事实题答错率约四分之一

AI 导读

基于 Artificial Analysis 的 AA-Omniscience 基准,Randall Olson 发布的图表显示,在 42 个工作领域的 6000 道具体事实题中,不开启搜索时顶级 AI 模型约四分之一的答案出错。结论是涉及重要事实时,用户仍需谨慎核验模型输出,不能完全依赖模型记忆。

来源:AGI Hunt · agihunt.info