AGI Hunt· deliprao·· 6 小时前AI 评分43
UPenn NLP 论文:声明验证基准主要测检索,推理能力被高估
AI 导读
UPenn NLP 论文用 GPT-4o-mini 为 9 个声明验证数据集、24K 条样本生成结构化推理轨迹,发现基准高分主要反映「检索+蕴含」能力而非真正推理,直接证据抽取占主导,多句综合与数值推理严重不足。数据集间偏差悬殊:有的几乎只测词面匹配,有的约半数样本需信息综合。作者另用 1B 参数小型推理验证器归纳出五类错误,并建议构建更具挑战性的评测套件。
来源:AGI Hunt · agihunt.info