AGI Hunt· basedjensen·· 3 小时前AI 评分46
OpenAI 数学模型在「All the Math We Can Think Of」基准仅得 9.3%,4000 题对 372
OpenAI 数学模型在「All the Math We Can Think Of」基准仅得 9.3%,4000 题对 372
AI 导读
网友实测显示,OpenAI 的数学模型在「All the Math We Can Think Of Bench」4000 题中仅命中 372 题,得分 9.3%。有人指出每题限时 3 小时可能偏低,更想了解失败案例分布以及哪类数学问题家族最顽强。这一成绩与 OpenAI 官方公布的定理级数学成果形成反差:前沿成果亮眼,但面对广义数学问题的覆盖率仍然很低。
来源:AGI Hunt · agihunt.info