跳到正文
热点事件持续更新

实测 LLM 评审 RAG 质量,gpt-4.1-nano 接近随机

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月,Giulio Zeloni 团队提出 evidence-first 的质量门禁框架 AGO,并对 LLM 能否胜任 RAG 质量评审做了实测。实验在 RAGBench 上进行,每评审 1200 个样本:gpt-4.1-nano 检测违规回答的 AUROC 仅 0.603,勉强高于随机水平;gpt-4o 的 AUROC 为 0.783。分领域来看,AUROC 在 0.62–0.88 之间波动。报道据此指出,gpt-4.1-nano 的评审表现接近随机。目前这是该事件公开披露的最新进展,暂无后续更新或更正。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    实测 LLM 做 RAG 质量评审:gpt-4.1-nano 的 AUROC 仅 0.603

    Giulio Zeloni 团队提出 evidence-first 质量门禁框架 AGO,并实测 LLM 评审 RAG 的质量:在 RAGBench 上每评审 1200 样本,gpt-4.1-nano 检测违规回答的 AUROC 仅 0.603,勉强高于随机,gpt-4o 为 0.783,但分领域在 0.62–0.88 之间波动。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。