跳到正文
热点事件持续更新

PADMÉ:LM智能体评估器元评估数据合成

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年9月30日,arXiv cs.CL 上线一篇论文,提出 PADMÉ——一种面向语言模型智能体评估器元评估的偏好对齐数据合成方法。该方法的特点是用小型语言模型自动合成元评估数据,无需人工参与标注。论文给出的原型结果显示,它在 4 个智能体领域、3 项评估标准下共合成 1,000 条样本;对其中的 150 条子集做人工验证后,合成数据与人类判断的一致率由朴素基线的 73% 提升至 85%。作者还用该数据集对 25 个常见模型进行元评估,发现评估表现与评分粒度、宽松度以及模型规模存在关联。目前该工作处于论文发布阶段,尚无后续独立复现或同行评审结论的报道。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv cs.CL
    PADMÉ:面向 LM 智能体评估器元评估的偏好对齐数据合成方法

    PADMÉ 用小型语言模型合成 LM 智能体评估器的偏好对齐元评估数据,无需人工参与。其原型在 4 个智能体领域、3 项评估标准下合成 1,000 条样本,150 条子集的人工验证显示与人类判断的一致率从朴素基线的 73% 升到 85%。用该数据集元评估 25 个常见模型,显示评估表现与评分粒度、宽松度和模型规模相关。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。