跳到正文
原文
arXiv cs.AI· Ziyang Xu, Haitian Zhong, Hao Zhou, Hao Qin, Chenhan Jin, Te Qi, Shengze Xu, Tieyong Zeng·· 4 小时前AI 评分42

更多程序还是更多次执行?LLM Harness 中覆盖率与专业化的分离

More Programs or More Rolls? Separating Coverage from Specialization in LLM Harnesses

AI 导读

受控评估在 MATH-500 的 386 个任务上对比 8 个生成式 harness 与 1 个 baseline 及 9 份字节相同副本,每个执行 3 次:完全相同的程序仍带来 2.16 个百分点的重复平均 oracle 余量。

来源:arXiv cs.AI · arxiv.org