热点事件持续更新
OpenAI数学模型基准仅得9.3%(372/4000)
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月7日,据 AGI Hunt 报道,网友实测显示 OpenAI 的数学模型在「All the Math We Can Think Of Bench」的 4000 道题中仅命中 372 题,得分 9.3%。有人指出每题限时 3 小时可能偏低,并希望进一步了解失败案例的分布,以及哪类数学问题家族最难攻克。报道同时提到,这一成绩与 OpenAI 官方公布的定理级数学成果形成反差:前沿成果亮眼,但面对广义数学问题的覆盖率仍然很低。目前该事件仅有这一轮实测结果与讨论,尚无 OpenAI 方面的回应或后续验证。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 07:37
网友实测 OpenAI 数学模型在该 4000 题基准中仅命中 372 题,得分 9.3%。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- AGI HuntOpenAI 数学模型在「All the Math We Can Think Of」基准仅得 9.3%,4000 题对 372
网友实测显示,OpenAI 的数学模型在「All the Math We Can Think Of Bench」4000 题中仅命中 372 题,得分 9.3%。有人指出每题限时 3 小时可能偏低,更想了解失败案例分布以及哪类数学问题家族最顽强。这一成绩与 OpenAI 官方公布的定理级数学成果形成反差:前沿成果亮眼,但面对广义数学问题的覆盖率仍然很低。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。