跳到正文
原文
arXiv cs.CL· Heyuan Huang, Jirui Dai, Alexandra DeLucia, Sonal Joshi, Mahsa Yarmohammadi, Jie Gao, Bernal Jim\'enez Guti\'errez, Mark Dredze·· 2 天前AI 评分39

检索式开放式评估为何失效?长文本医学答案事实性验证的自动分类体系

Where Does Retrieval-Based Open-Ended Evaluation Fail? Automatic Taxonomy Induction from Long-Form Medical Answer Factuality Verification

AI 导读

一项案例研究提出两套分类体系,把检索式医学事实核查的失败拆解为检索阶段五类质量维度错误与验证推理六步错误。研究基于 MedExpert 开放式数据集和 3 个封闭式数据集,用 LLM-as-Judge 自动标注,并在 4 种检索方法与 6 个前沿验证模型上压力测试。结果显示扩大模型规模、增加推理投入、纳入权威网络来源与医学微调都无法消除这些失败模式。

来源:arXiv cs.CL · arxiv.org