AGI Hunt· marktenenholtz·· 3 小时前AI 评分41
Mark Tenenholtz:未饱和的旧基准,余量多半来自烂任务和烂评分
Mark Tenenholtz:未饱和的旧基准,余量多半来自烂任务和烂评分
AI 导读
Mark Tenenholtz 认为,大多数超过 2-3 个月仍未饱和的基准,剩余提升空间多半来自任务本身写得糟糕、评分实现得很差或两者兼有,而非模型能力真有差距。他把这视为对当前 AI 榜单可信度的直接质疑。
来源:AGI Hunt · agihunt.info