跳到正文
原文
arXiv cs.CL· Jorma Valjakka, Juhani Kivim\"aki, Juha Myll\"ari, Jukka K. Nurminen·· 4 小时前AI 评分42

LLM 幻觉检测基准中的标注问题:一项实证评估

The Labeling Problem in Hallucination Detection Benchmarks: An Empirical Evaluation

AI 导读

三个 QA 数据集、900 条人工标注问答对显示,七个 LLM judge 等自动标注器在幻觉检测基准上与人工标注分歧显著,多数策略存在方向性错误偏差。对多数 judge-generator 组合,把 faithfulness 提示词换成 factual correctness 提示词可提升与人工标注一致度并减少假阳性主导。

来源:arXiv cs.CL · arxiv.org