跳到正文
热点事件持续更新

审计7款LLM评测工具:13处打分与实际检查不符

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月6日,AGI Hunt 报道称,一名作者用一个月时间阅读了 7 款常用于评估 Claude Code skill 与 LLM 应用的评测工具的打分源码,包括 agent-skills 仓库的 eval harness、NVIDIA SkillEvaluator,以及 MLflow、LangSmith、DSPy、DeepEval、Harbor。审计结果显示,共有 13 处分数或通过判定并不被这些工具的实际检查所支撑,报道称每处都可复现,并附有复现步骤。目前公开的信息仅限于对上述 7 款工具、13 处问题的审计结论;报道未提及相关工具方是否回应,也未说明是否已有修复或后续核查安排。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. AGI Hunt精选
    审计 7 款 LLM 评测工具源码,发现 13 处打分与实际检查不符

    作者用一个月阅读 7 款常用于评估 Claude Code skill 与 LLM 应用的工具打分源码,包括 agent-skills 仓库的 eval harness、NVIDIA SkillEvaluator 以及 MLflow、LangSmith、DSPy、DeepEval、Harbor,发现 13 处分数或通过判定并不被其实际检查支撑,每处都可复现并附了复现步骤。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。