跳到正文
原文
arXiv cs.AI· Yerim Oh, Young-Jun Lee, Jaewoo Ahn, Gunhee Kim, Dongyeop Kang·· 4 小时前AI 评分47

SciSlopBench:AI 生成论文"科学注水"的基准评测与 SciSlopHarness 缓解框架

Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers

AI 导读

SciSlopBench 用 390 篇 AI 生成论文(每篇配一篇研究问题与贡献类型匹配的人类论文)评测"科学注水",六项指标以 85.9% 准确率区分 AI 与人类论文。注水程度越高,ICLR 评分越低。配套的 SciSlopHarness 无需人类参考即可将剩余 AI-人类差距较最强基线缩小 63%。

来源:arXiv cs.AI · arxiv.org