跳到正文
原文
arXiv cs.AI· Nishtha N. Vaidya, Stephan Grimm, Thomas Hubauer, Thomas A. Runkler·· 4 小时前AI 评分33

本体接地、推理器验证的科学 AI LLM 推理评测基准

Ontology-Grounded, Reasoner-Verified Benchmarks for Evaluating LLM Reasoning in Scientific AI

AI 导读

提出一条从 OWL 2 本体自动生成多项选择题(MCQ)基准的流水线,正确答案由本体接地、干扰项经 OWL 推理器蕴含检查形式化验证。在 Pizza、PMDco、DOID 上分别生成 112、2,491、15,216 道 MCQ,LLM judge 流畅度均分 4.02、4.36、3.36(满分 5),正确项与干扰项相似度超 0.8。

来源:arXiv cs.AI · arxiv.org