跳到正文
热点事件持续更新

Teknium 回应 Hermes 评测基准争议

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月7日,AGI Hunt 报道,Nous Research 的 Teknium 就 Hermes 模型评测基准争议作出回应。此前有网友质疑 Hermes 的评测方式,认为 terminal bench 与科学类评测与个人助理场景无关,指数化综合榜单会误导日常用户,让人以为必须使用 Opus 5.5。Teknium 澄清 Hermes 并非只面向个人助理,约50%的用户用它来做编码;他表示各类能力有独立分榜,并非只有指数化综合榜单。双方随后就基准设计是否存在过拟合展开争论。目前争论仍在进行,报道中未提及结论。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    Teknium 回应评测争议:半数 Hermes 用户拿来写代码

    Nous Research 的 Teknium 回应网友对 Hermes 模型评测基准的质疑,澄清 Hermes 不只是个人助理,50% 的用户用它做编码。质疑方认为 terminal bench 与科学类评测对个人助理场景无关,指数化综合榜单会误导日常用户以为必须用 Opus 5.5。Teknium 表示各类能力有独立分榜,双方就基准设计是否过拟合展开争论。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。