热点事件持续更新
CompMat-Bench:材料科学AI智能体基准
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月2日,arXiv cs.AI 刊出 CompMat-Bench,一个面向计算材料科学的 AI 智能体基准测试。该基准包含 94 个任务,针对计算材料研究中的单步研究任务,其做法是预先复现这些研究的输入与输出,并以此作为标准答案;评分采用固定规则而非 LLM judge,以避免模型裁判带来的不确定性。评测设置了四种条件:单任务与工作流两类任务形态,分别搭配完整方法指导与简化方法指导。目前进展方面,三个 LLM 智能体在单任务、完整指导的条件下通过率为 66.0%-90.4%;当任务变成更长的工作流,或提供的指导更少时,通过率随之下降。结果显示,多数失败属于科学层面的错误,而非软件使用错误。
AI 根据报道生成 · 1 小时前更新
最新进展10月2日 12:00
三个 LLM 智能体在单任务完整指导下通过率为66.0%-90.4%,工作流更长或指导更少时表现下降。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv cs.AICompMat-Bench:面向计算材料科学的 AI 智能体基准测试
CompMat-Bench 是一个含 94 个任务的 AI 智能体基准,用于评测计算材料研究的单步研究任务。它预先复现研究的输入与输出作为标准答案,以固定规则而非 LLM judge 评分,提供单任务/工作流与完整/简化方法指导四种条件。三个 LLM 智能体在单任务完整指导下通过率为 66.0-90.4%,工作流更长或指导更少会拉低表现,多数失败属科学错误而非软件使用错误。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。