热点事件持续更新
提出PFaithBench成对忠实性评测基准
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月7日,arXiv cs.CL 上的一项研究提出成对忠实性基准 PFaithBench,用于考察大模型能否在支持性与非支持性上下文下,对同一问题在作答与拒答之间正确切换。研究对 39 个模型、7 个模型家族进行评测,结果显示忠实性本质上是作答与拒答之间的权衡:多数模型强烈偏向作答,多数忠实性错误源于过度作答。训练实验表明结果对作答与拒答数据的构成高度敏感——数据来源不匹配会让模型依赖数据集捷径,增加答案监督数据会加剧过度作答,增加拒答数据虽减少幻觉却带来过度拒答。论文的代码与数据已公开。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
研究发布成对忠实性基准 PFaithBench,评测39个模型并公开代码数据。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv cs.CL重新审视 LLM 忠实性:成对上下文敏感视角与 PFaithBench 基准
研究者提出成对忠实性基准 PFaithBench,考察模型能否在支持性与非支持性上下文下对同一问题切换作答与拒答。对 39 个模型、7 个模型家族的评测显示,忠实性本质是作答与拒答的权衡,多数模型强烈偏向作答,多数忠实性错误源于过度作答。训练结果对作答与拒答数据构成高度敏感:来源不匹配会使模型依赖数据集捷径,增加答案监督数据加剧过度作答,增加拒答数据减少幻觉却带来过度拒答;代码与数据已公开。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。