热点事件持续更新
Toolery 基准实测 15 个本地模型工具调用
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
2026 年 10 月 5 日,AGI Hunt 发布一项实测结果:作者使用 Toolery 基准对 15 个本地模型进行 agent 能力与工具调用能力的测试。结果显示,qwen3.8-27b 以 71.8% 的成绩排在首位;mellum2-12b-a2.5b-thinking 以 71.4% 位居第二,gemma-4-26b-a4b 以 70.4% 紧随其后,三者成绩较为接近。榜单末端,prism-ml/bonsai-27b 以 50.5% 垫底,与榜首相差约 21 个百分点。报道未披露测试的具体题目构成、评分口径、运行环境或各模型其余名次的完整数据,也未说明测试次数与误差范围,因此各模型之间的细微分差是否具有统计意义尚无法从该报道判断。截至该报道,这是本事件唯一一次公开的 Toolery 基准实测结果,尚无其他来源的复现或对比数据。
AI 根据报道生成 · 57 分钟前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- AGI HuntToolery 基准实测 15 个本地模型工具调用:qwen3.8-27B 居首,Bonsai 27B 垫底
作者用 Toolery 基准实测 15 个本地模型的 agent 与工具调用能力,qwen3.8-27b 以 71.8% 居首,mellum2-12b-a2.5b-thinking 71.4%、gemma-4-26b-a4b 70.4% 紧随其后,prism-ml/bonsai-27b 以 50.5% 垫底。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。