跳到正文
热点事件持续更新

benchmark 报告缺 95% 置信区间引吐槽

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 1 日,AGI Hunt 报道,评论者 rmcwhorter99 在 X 上吐槽 AI 实验室发布 benchmark 成绩时从不附 95% 置信区间误差线,并称哪家都一样,若加上误差线,时间线能聪明半个标准差。报道指出,这条短评点破了行业通病:模型评测分数普遍不报告统计不确定性,采样波动、题集差异带来的小幅分数差异,常被当成真实能力差距传播。目前该话题仍停留在评论者个人吐槽与媒体转述阶段,尚无实验室或评测机构作出回应,也未见相关评测规范调整的报道。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. AGI Hunt
    benchmark 报告该加 95% 置信区间了:吐槽评测分数缺误差线

    评论者 rmcwhorter99 在 x 上吐槽 AI 实验室发布 benchmark 成绩从不附 95% 置信区间误差线,称哪家都一样,加上误差线时间线能聪明半个标准差。这条短评点破行业通病:模型评测分数普遍不报告统计不确定性,采样波动、题集差异带来的小幅分数差异常被当成真实能力差距传播。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。