AGI Hunt· antoine_chaffin·· 2 小时前AI 评分31
Decider 模型作者回应刷榜质疑:新榜单公私集差距小,称增强非 benchmaxxing
厂商回应刷榜质疑:新榜单公私集差距小,称增强非 benchmaxxing
AI 导读
Decider 模型作者 antoine_chaffin 回应 benchmaxxing 质疑,称其模型在新发布的全新排行榜上保持 top-1,且公开集与私有集之间的差距很小。他称有些模型在私有集上崩了而自己的没有,以此作为模型增强并非针对榜单过拟合的证据。原帖未指明具体模型与榜单细节。
来源:AGI Hunt · agihunt.info