跳到正文
原文
HuggingFace Blog·· 28 天前AI 评分46

BenchMIRT:LLM 基准测试究竟在测什么?

BenchMIRT: What are LLM benchmarks actually measuring?

AI 导读

BenchMIRT 是一种在单条 prompt 层面审计 LLM 基准测试的新方法,基于多维 IRT。它用 100 个 LLM、16 个 benchmark、超 34K 道题的结果训练,未被告知各 benchmark 测什么,却独立恢复出安全与通用推理两大维度。分析还发现 BBQ、WMDP 的得分更贴近通用推理而非安全。

来源:HuggingFace Blog · huggingface.co