跳到正文
原文
AGI Hunt· Potential-Net-9375·· 3 小时前AI 评分41

自建 200 题数据集横评 10 款模型:Gemma-4-26B 屠榜,量化后仍居 S 级

自建 200 任务数据集实测:Gemma 26B 屠榜,量化后仍居 S 级

AI 导读

Reddit 用户自建 200 题数据集,横评 10 个 2B MoE 至 27B Dense 模型,Gemma-4-26B 居 S 级榜首,量化到 iq3s 仍第一。Qwen3.8-27B(q3/q5)、Qwen3.5-9B 列 A 级,Ling-3.0-tiny、MiniCPM 为 F 级。测试考察模型在 LLM 集群「Hive」中调用自定义工具,过重模型反而拖慢速度。

来源:AGI Hunt · agihunt.info