AGI Hunt· Teknium·· 4 小时前AI 评分29
Teknium 回应评测争议:半数 Hermes 用户拿来写代码
AI 导读
Nous Research 的 Teknium 回应网友对 Hermes 模型评测基准的质疑,澄清 Hermes 不只是个人助理,50% 的用户用它做编码。质疑方认为 terminal bench 与科学类评测对个人助理场景无关,指数化综合榜单会误导日常用户以为必须用 Opus 5.5。Teknium 表示各类能力有独立分榜,双方就基准设计是否过拟合展开争论。
来源:AGI Hunt · agihunt.info