跳到正文
原文
AGI Hunt· antoine_chaffin·· 2 小时前AI 评分31

Decider 模型作者回应刷榜质疑:新榜单公私集差距小,称增强非 benchmaxxing

厂商回应刷榜质疑:新榜单公私集差距小,称增强非 benchmaxxing

AI 导读

Decider 模型作者 antoine_chaffin 回应 benchmaxxing 质疑,称其模型在新发布的全新排行榜上保持 top-1,且公开集与私有集之间的差距很小。他称有些模型在私有集上崩了而自己的没有,以此作为模型增强并非针对榜单过拟合的证据。原帖未指明具体模型与榜单细节。

来源:AGI Hunt · agihunt.info