热点事件持续更新
Teknium 回应 Hermes 评测基准争议
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月7日,AGI Hunt 报道,Nous Research 的 Teknium 就 Hermes 模型评测基准争议作出回应。此前有网友质疑 Hermes 的评测方式,认为 terminal bench 与科学类评测与个人助理场景无关,指数化综合榜单会误导日常用户,让人以为必须使用 Opus 5.5。Teknium 澄清 Hermes 并非只面向个人助理,约50%的用户用它来做编码;他表示各类能力有独立分榜,并非只有指数化综合榜单。双方随后就基准设计是否存在过拟合展开争论。目前争论仍在进行,报道中未提及结论。
AI 根据报道生成 · 3 小时前更新
最新进展10月7日 13:36
Teknium 称半数 Hermes 用户用于编码,并强调各类能力有独立分榜,双方就基准是否过拟合仍在争论。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- AGI HuntTeknium 回应评测争议:半数 Hermes 用户拿来写代码
Nous Research 的 Teknium 回应网友对 Hermes 模型评测基准的质疑,澄清 Hermes 不只是个人助理,50% 的用户用它做编码。质疑方认为 terminal bench 与科学类评测对个人助理场景无关,指数化综合榜单会误导日常用户以为必须用 Opus 5.5。Teknium 表示各类能力有独立分榜,双方就基准设计是否过拟合展开争论。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。