热点事件持续更新
实测 LLM 评审 RAG 质量,gpt-4.1-nano 接近随机
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月,Giulio Zeloni 团队提出 evidence-first 的质量门禁框架 AGO,并对 LLM 能否胜任 RAG 质量评审做了实测。实验在 RAGBench 上进行,每评审 1200 个样本:gpt-4.1-nano 检测违规回答的 AUROC 仅 0.603,勉强高于随机水平;gpt-4o 的 AUROC 为 0.783。分领域来看,AUROC 在 0.62–0.88 之间波动。报道据此指出,gpt-4.1-nano 的评审表现接近随机。目前这是该事件公开披露的最新进展,暂无后续更新或更正。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- AGI Hunt实测 LLM 做 RAG 质量评审:gpt-4.1-nano 的 AUROC 仅 0.603
Giulio Zeloni 团队提出 evidence-first 质量门禁框架 AGO,并实测 LLM 评审 RAG 的质量:在 RAGBench 上每评审 1200 样本,gpt-4.1-nano 检测违规回答的 AUROC 仅 0.603,勉强高于随机,gpt-4o 为 0.783,但分领域在 0.62–0.88 之间波动。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。