AGI Hunt· maverick_man1111·· 2 小时前精选AI 评分72
审计 7 款 LLM 评测工具源码,发现 13 处打分与实际检查不符
AI 导读
作者用一个月阅读 7 款常用于评估 Claude Code skill 与 LLM 应用的工具打分源码,包括 agent-skills 仓库的 eval harness、NVIDIA SkillEvaluator 以及 MLflow、LangSmith、DSPy、DeepEval、Harbor,发现 13 处分数或通过判定并不被其实际检查支撑,每处都可复现并附了复现步骤。
推荐理由
作者逐行核对 7 款评测工具的打分源码,给出可复现的 13 处问题,可作评测工具选型与自建 harness 的核查参考。
来源:AGI Hunt · agihunt.info