AGI Hunt· Muhan Zhang·· 2 小时前AI 评分42
Endless Exam 基准:14 类数学构造题检验模型能否超越人类前沿
Endless Exam 基准:14 类数学构造题检验模型能否超越人类前沿
AI 导读
浙大 Muhan Zhang 团队在 Hugging Face 发布 Endless Exam 基准,用 14 个参数化数学构造题族检验模型能否超越已发表数学前沿。9 个模型在 69 个实例上测试,30 个公开前沿参考无一被超越,但连续质量分能区分模型间表现。生成器、验证器、参考答案与模型响应全部开源。
来源:AGI Hunt · agihunt.info