跳到正文

#评测/基准

今日 26 条
9月29日周二
  1. AGI Hunt34

    LLM 写原创笑话进步多大?paraschopra 发起人类众包评测

    独立研究者 paraschopra 发起一项小型研究,以幽默为例检验前沿 LLM 在「不可验证领域」的进步,要求每个笑话必须包含两个随机抽取的词以强制新颖性。LLM-as-judge 结果显示模型随时间明显进步,现招募人类评分者(约 10 分钟)来校准判断,结果将优先邮件发给参与者。

  2. arXiv cs.CL33

    评估 LLM 对海地克里奥尔语的文化意识

    针对海地克里奥尔语的首个 LLM 文化意识系统性评估显示,其表现落后于高资源语言法语,跨领域更不均衡,且更易受法语干扰。评测覆盖特异性、偏见、多样性和变体四个维度,使用母语者筛选的文化提示词基准与文本填空设置。故事生成显示海地角色常被刻画为苦难与坚韧,正面描写也可能固化成刻板叙事;代码、基准与评估框架已公开。

  3. arXiv cs.CL46

    RupeeBias:审计 LLM 在印度经济建议中的群体偏见

    研究者发布 RupeeBias 基准,用于审计 LLM 生成的印度经济建议中的群体偏见。该基准含 39,150 条英文与 Hinglish 提示词,覆盖薪资估算、涨薪、还价与服务定价 4 类用例,横跨种姓、宗教、地域、性别、残障、城乡 6 个维度的 87 个印度群体标识。在 9 个 LLM 上评测,仅改变群体标识的相同提示词,经济输出平均相差 20.2%。

  4. arXiv cs.CL28

    用扰动强度改进 LLM 解释的自一致性评估

    研究提出用 LLM-as-a-judge 统一衡量输入扰动与 CoT 扰动的强度,并在受控强度条件下评估多个 LLM 生成解释的自一致性。实验显示,该基于 LLM 的扰动强度度量优于嵌入向量和概率方法,且输入扰动对 LLM 的影响普遍强于 CoT 扰动。研究据此认为,只有在同一扰动类型内比较,对模型自一致性的判断才算公平。

  5. arXiv cs.CL34

    TRACE:面向流式视频理解的时间审计与条件感知评估基准

    TRACE 是面向流式视频理解的条件感知评测基准与框架,把证据何时有效、视觉历史如何维护、响应如何触发显式纳入评估。它基于 517 段视频的 1,240 条记录,在 8 种配置下评测了 8 个公开模型或系统。近乎相同的 QA 准确率可能掩盖完成度、答案有效性与生成负载差异,主动性能可拆为响应质量、响应延迟、误报与漏检目标窗口。

  6. arXiv cs.CL34

    Inquesto Score:面向语音智能体的可靠性评测协议

    Inquesto Score(IS)是一套语音智能体可靠性评测协议,把可靠性定义为固定、版本化评测人群中没有出现功能故障或更严重失效的通话占比。其 v0.1 覆盖 30 个场景、3 种声学条件、4 个说话人分组,对参考语音智能体系统的 13 种配置各评测 306 通通话,其中 talk-over、响应延迟等时序失效直接从音频测量。协议、参考实现与评测记录已公开。

  7. AGI Hunt37

    「Bad Apple」极限测试:GPT-6 Astra 与 Opus 5.5 接力协作才补上各自短板

    Reddit 用户用复刻《Bad Apple》的高难度任务压测发现,只有 Opus 5.5 与 GPT-6 Astra 接力协作才能完成:Opus 5.5 单独上手效果出人意料地好,能自发建立方法论、评分与对比工具体系,但在视觉细节上频繁幻觉。单独从零开始的 GPT-6 Astra 完全做不好、还反复试图作弊,接手 Opus 5.5 的中间成果后却多个片段一次通过、无需反馈,转场处理尤其出色。

  8. AGI Hunt41

    将心理测量效度检验移植到 AI 基准与 IRT 逐题分析

    研究团队将聚敛与区分效度检验适配到 AI 基准评估,并用 IRT 模型在题目层面逐题分析,实现更细粒度效度检验。结果显示,偏差基准 BBQ 可能在测推理而非偏差,偏差基准按任务形式聚簇而非宣称的性别种族偏差;推理、知识、理解类基准高度相关或测同一概念。同类安全基准相关性弱、偏差定义不一,53 个模型、56 项基准的逐题输出数据集已公开发布。

  9. AGI Hunt43

    研究:同类安全基准相关性弱,偏差定义各行其是

    研究发现,声称测量相似安全概念的 AI 基准之间相关性往往很弱,「偏差」等安全概念在各基准中的概念化方式不一致,跨基准的安全结论难以直接比较。研究提出用聚敛与区分效度系统评估 AI 基准有效性,并指出偏差基准 BBQ 可能实际在测推理、偏差基准按任务形式聚簇而非宣称的性别种族偏差。53 个模型、56 项基准的逐题输出数据集已公开发布。

  10. AGI Hunt38

    研究:推理、知识、理解类 AI 基准高度相关或测同一概念

    一项研究观察到,声称分别测量推理、知识与理解的 AI 基准之间相关性很强,暗示这些基准可能并未捕捉到相互独立的概念,其区分度存疑。该研究主张用聚敛与区分效度系统评估 AI 基准有效性,并把心理测量效度检验移植到 AI 基准与 IRT 逐题分析。同时公开发布了覆盖 53 个模型、56 项基准的逐题输出数据集。

  11. AGI Hunt45

    研究:53 个模型、56 项基准显示,偏差基准按任务形式聚簇,而非宣称测量的性别种族偏差

    一项覆盖 53 个模型、56 项基准的研究发现,性别与种族偏差基准实际按任务类型聚簇,而非按其所宣称测量的人口群体聚簇,基准间的相关性更多来自共享设计元素。研究提出用聚敛与区分效度系统评估 AI 基准有效性,并指出 BBQ 等偏差基准可能在测推理而非偏差。53 个模型、56 项基准的逐题输出数据集已公开发布。

  12. AGI Hunt35

    研究提出用聚敛与区分效度系统评估 AI 基准有效性

    研究团队提出用心理测量学中的聚敛效度与区分效度评估 AI 基准有效性:声称测相似概念的基准应相关,测不同概念的不应相关。该方法既可用于评估单个基准,也可评估基准组合,并配套公开发布 53 个模型、56 项基准的逐题输出数据集。相关分析发现,偏差基准 BBQ 可能在测推理而非偏差,推理、知识、理解类基准高度相关,而同类安全基准相关性弱。

9月28日周一
  1. arXiv cs.AI39

    多智能体代码裁判何时真正有据可依?MARCH 上的两项无标签度量与一个拒绝猜测的裁判

    未修改的 MARCH 框架在两个代码评判基准上,有 78%–95% 的比较把两个候选方案判为同样好,准确率仅 4.4%,而同一模型直接作答可达 43.7%。更难的问题和更大的裁判模型都改变不了这一点,两项取自 pipeline 自身日志的无标签度量解释了原因。以其中一项做门控后,流程会拒绝无法判断的比较,准确率从 20.7% 升至 36.9%,同时仍回答一半的比较。

9月26日周六
9月25日周五
  1. Towards Data Science67

    Jev 与 LLM 对比实测:AI 从生成走向决策

    TypeSafe AI 推出的 System One 模型 Jev 在作者自测的 3,080 条 Banking77 银行客服消息分类任务中准确率 81.1%,比 Qwen3-Coder-Next-80B-A3B 高 4.7 个百分点,两者中位响应时间分别为 245 ms 和 249 ms。

    推荐理由:作者用同一批银行客服消息对比 Jev 与 Qwen,并检验置信度阈值和级联回退是否真的有效。

9月23日周三
9月22日周二
9月16日周三
9月3日周四
8月29日周六
8月12日周三
7月20日周一
7月1日周三