跳到正文
原文
AGI Hunt· airesearch12·· 9 小时前AI 评分29

JevBench v1.6.0 重测 92 个模型,榜首换血并新增 22 语言细分

AI 导读

JevBench 发布 v1.6.0,在全新密封测试集上重测全部 92 个 Jev 级模型,Quyet-1.0-Large 以 81.7 分登顶能力榜,超过 deck-31B 的 77 分。新版新增 22 种语言细分打分,deck-31B 德语 97 分、Quyet 94 分,31B 级模型表现坚挺,而若干 4B 小模型的多语种能力出现崩塌。

来源:AGI Hunt · agihunt.info