跳到正文
热点事件持续更新

OpenAI数学模型基准仅得9.3%(372/4000)

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月7日,据 AGI Hunt 报道,网友实测显示 OpenAI 的数学模型在「All the Math We Can Think Of Bench」的 4000 道题中仅命中 372 题,得分 9.3%。有人指出每题限时 3 小时可能偏低,并希望进一步了解失败案例的分布,以及哪类数学问题家族最难攻克。报道同时提到,这一成绩与 OpenAI 官方公布的定理级数学成果形成反差:前沿成果亮眼,但面对广义数学问题的覆盖率仍然很低。目前该事件仅有这一轮实测结果与讨论,尚无 OpenAI 方面的回应或后续验证。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    OpenAI 数学模型在「All the Math We Can Think Of」基准仅得 9.3%,4000 题对 372

    网友实测显示,OpenAI 的数学模型在「All the Math We Can Think Of Bench」4000 题中仅命中 372 题,得分 9.3%。有人指出每题限时 3 小时可能偏低,更想了解失败案例分布以及哪类数学问题家族最顽强。这一成绩与 OpenAI 官方公布的定理级数学成果形成反差:前沿成果亮眼,但面对广义数学问题的覆盖率仍然很低。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。