arXiv cs.AI· Yerim Oh, Young-Jun Lee, Jaewoo Ahn, Gunhee Kim, Dongyeop Kang·· 4 小时前AI 评分47
SciSlopBench:AI 生成论文"科学注水"的基准评测与 SciSlopHarness 缓解框架
Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers
AI 导读
SciSlopBench 用 390 篇 AI 生成论文(每篇配一篇研究问题与贡献类型匹配的人类论文)评测"科学注水",六项指标以 85.9% 准确率区分 AI 与人类论文。注水程度越高,ICLR 评分越低。配套的 SciSlopHarness 无需人类参考即可将剩余 AI-人类差距较最强基线缩小 63%。
来源:arXiv cs.AI · arxiv.org