跳到正文
原文
arXiv cs.AI· Chenmu Zhang, Levi Felix, Jun-Jie Zhang, Xingfu Li, Xuelian Jiang, Tao Jiang, Subhendu Mishra, Xixi Qin, Boris Yakobson·· 4 小时前AI 评分37

CompMat-Bench:面向计算材料科学的 AI 智能体基准测试

CompMat-Bench: Benchmarking AI Agents for Computational Materials Science

AI 导读

CompMat-Bench 是一个含 94 个任务的 AI 智能体基准,用于评测计算材料研究的单步研究任务。它预先复现研究的输入与输出作为标准答案,以固定规则而非 LLM judge 评分,提供单任务/工作流与完整/简化方法指导四种条件。三个 LLM 智能体在单任务完整指导下通过率为 66.0-90.4%,工作流更长或指导更少会拉低表现,多数失败属科学错误而非软件使用错误。

来源:arXiv cs.AI · arxiv.org