热点事件持续更新
CruxBench:评测 LLM 信息发现能力的新基准
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
2026 年 9 月 30 日,arXiv cs.CL 发布 CruxBench,一个用于评测大模型信息发现能力的基准。该基准按信息价值(VOI)为模型生成的问题打分,衡量模型能否把难题拆解为关键子问题(cruxes)。其 ground truth 取自未来真实事件,天然抗污染,并支持开放式文本提交。研究在 293 个预测问题上评测了 8 个模型,结果显示 VOI 与模型能力的独立度量相关性达 r=0.90,但信息发现对前沿 LLM 仍然困难,表现仅略高于随机时序基线。
AI 根据报道生成 · 3 小时前更新
最新进展9月30日 12:00
CruxBench 在 293 个预测问题上评测 8 个模型,显示前沿 LLM 信息发现仅略高于随机基线。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv cs.CLCruxBench:评测 LLM 信息发现能力的基准
CruxBench 是按信息价值(VOI)给 LLM 生成问题打分的新基准,用于衡量模型将难题拆解为关键子问题(cruxes)的信息发现能力。其 ground truth 来自未来真实事件,天然抗污染,支持开放式文本提交,在 293 个预测问题上评测了 8 个模型。VOI 与模型能力的独立度量相关性达 r=0.90,但信息发现对前沿 LLM 仍困难,仅略高于随机时序基线。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。