跳到正文
原文
AGI Hunt· sanmikoyejo·· 3 小时前AI 评分39

斯坦福 arXiv 论文《How Reusable Are Benchmarks with Richer Feedback?》:多准则基准所需测试集规模随准则数指数增长

arXiv 论文:追踪多准则最佳模型所需数据量随准则数指数增长

AI 导读

斯坦福 Allouah 与 Duchi 的 arXiv 论文证明,固定精度与置信度下估计 k 个评测准则任意凸组合的最佳分数,最坏情况所需测试集规模随 k 指数增长,O(log k) 个准则的成本相当于 k 个自适应统计查询的 Θ(√k) 代价。

来源:AGI Hunt · agihunt.info