AGI Hunt· ryunuck·· 4 小时前AI 评分34
研究者吐槽:真强者应是「评测全崩但坚称榜单是垃圾」的模型
研究者吐槽:真强者应是「评测全崩但坚称榜单是垃圾」的模型
AI 导读
研究者 ryunuck 在 x 提出反直觉观点:真正的强模型应是不刷爆任何 benchmark、作者还坚决回击称「你们的评测都是垃圾」的模型。这讽刺了 AI 圈过度依赖公开榜单的评测文化——当实验室都围绕同一批 benchmark 优化时,榜单成绩与真实能力可能脱节。作者期待的信号是模型强到让现有评测体系失效,而非在现有体系里拿高分。
来源:AGI Hunt · agihunt.info