跳到正文
原文
AGI Hunt· Giulio Zeloni·· 3 小时前AI 评分55

实测 LLM 做 RAG 质量评审:gpt-4.1-nano 的 AUROC 仅 0.603

实测 LLM 当 RAG 质量评审:gpt-4.1-nano 仅比瞎猜略好

AI 导读

Giulio Zeloni 团队提出 evidence-first 质量门禁框架 AGO,并实测 LLM 评审 RAG 的质量:在 RAGBench 上每评审 1200 样本,gpt-4.1-nano 检测违规回答的 AUROC 仅 0.603,勉强高于随机,gpt-4o 为 0.783,但分领域在 0.62–0.88 之间波动。

来源:AGI Hunt · agihunt.info