跳到正文
原文
arXiv cs.CL· Gauransh Kumar, Luciano Marchezan, Guillaume Genois, K\'evin Delcourt, Eugene Syriani·· 2 天前AI 评分30

系统性综述筛选自动化的基准框架:SRBench 与 PromptSR

A Benchmark Framework for Screening Automation in Systematic Reviews

AI 导读

SRBench 基准数据集以 45,064 条标注数据评估 LLM 在系统性综述(SR)筛选中的表现,覆盖 32 项精选二次研究。其评测框架考虑 SR 中排除文章天然多于纳入文章的类别不平衡问题,并指出传统指标在这类高度不平衡场景下可能产生误导;配套的 PromptSR 工具支持提示词实验、实验管理与结果分析。

来源:arXiv cs.CL · arxiv.org