跳到正文

#评测/基准

今日 25 条
今天9月30日周三
  1. arXiv cs.CL35

    校准的是谁?人格设定与语言对 TypeSafe JEV 文化价值观的影响

    研究者用 Values Survey Module 2013 审计 TypeSafe 决策式模型 JEV 的文化价值观,以沙特与美国人格设定、英语和阿拉伯语收集 288,000 条答案。JEV 回答高度可重复(ICC 0.997),无人格时接近其美国人格;沙特人格下向人类沙特-美国差异移动,英文复现 87%、阿拉伯语 62%,长期取向反转。

  2. arXiv cs.AI39

    工程化简洁:简单机制界面引导 LLM 智能体

    在拍卖与匹配这类规则明确的多智能体环境中,简单的机制界面能引导 LLM 智能体做出更好决策:跨四个模型家族,升价拍卖界面大幅降低出价偏差。列出收益情形并解释说真话为何安全同样改善选择,而要求规划匹配轮次或推测对手信念的提示词整体拉低表现。拍卖中的行为提升并未同步反映在智能体简短计划的可测战略理解语言指标上。

  3. arXiv cs.CL46

    迷失在翻译中:测量非母语英语对大语言模型终端用户表现的影响

    FABLE 数据集用 174K 条真实用户提示词生成 190,911 条英文提示词变体,测量非母语英语对大语言模型用户表现的影响。在 34 个开放权重 LLM 上的评测显示,模型不会把拼写错误带入输出,却会复制提示词中更高层的修辞与词汇特征。最流畅与最不流畅提示词的答案质量差异显著,非母语英语用户得到质量更低、流畅度更差的回答。

  4. arXiv cs.CL38

    PADMÉ:面向 LM 智能体评估器元评估的偏好对齐数据合成方法

    PADMÉ 用小型语言模型合成 LM 智能体评估器的偏好对齐元评估数据,无需人工参与。其原型在 4 个智能体领域、3 项评估标准下合成 1,000 条样本,150 条子集的人工验证显示与人类判断的一致率从朴素基线的 73% 升到 85%。用该数据集元评估 25 个常见模型,显示评估表现与评分粒度、宽松度和模型规模相关。

  5. arXiv cs.CL38

    CruxBench:评测 LLM 信息发现能力的基准

    CruxBench 是按信息价值(VOI)给 LLM 生成问题打分的新基准,用于衡量模型将难题拆解为关键子问题(cruxes)的信息发现能力。其 ground truth 来自未来真实事件,天然抗污染,支持开放式文本提交,在 293 个预测问题上评测了 8 个模型。VOI 与模型能力的独立度量相关性达 r=0.90,但信息发现对前沿 LLM 仍困难,仅略高于随机时序基线。

  6. arXiv cs.AI45

    EU AI Act 合规检查器实证研究:12 款主流工具仅能作早期方向指引

    首个 EU AI Act 合规检查器(AIACC)实证研究评估 12 款主流工具,发现其质量差异显著,目前只能充当早期方向指引工具。这些工具交互模式与易用性不一致,倾向过度简化或遗漏关键义务,无法提供确定、可执行的指导,依赖其可能带来虚假的合规感。研究据此提出更可靠合规支持工具的设计原则。

  7. arXiv cs.CL45

    BreakingWeb:用受控环境干预构建高难度浏览器使用任务

    BreakingWeb 用受控环境干预改造浏览器智能体已能解决的任务,使其平均通过率下降 22.9%。基准含 7 个自托管网站的 519 对原始/干预任务和 29 类干预,并推翻各智能体近半数原本能干净解决的任务。人类首次尝试仅下降 10.0%;六款智能体 75% 的失败属“信念失败”——变更未发生却宣称成功,代码、数据与环境已公开。

  8. arXiv cs.CL36

    车载对话助手(ICA)多轮对话的自动化评估框架

    车载对话助手(ICA)的多轮对话能力评估有了自动化框架:闭环仿真结合策略引导的用户模拟器与对抗式策略管理器,由两级 LLM 评判器评估单轮失败和整段对话质量。在一款工业级 ICA 上用 6 个 LLM 后端和 12 名人工标注者验证,自动评判与人类一致性较高;策略引导比无引导仿真每段对话多发现 2.96 倍独特失败类型,独特失败对话数翻倍以上。

  9. arXiv cs.CL32

    评估提示词扰动对大语言模型偏见与幻觉的影响

    研究发现,对决策任务中的原始提问做扰动式改写,可缓解部分大语言模型的偏见与幻觉,结论与此前研究相反。在多数数据集任务上 Claude 3 表现更有效,GPT3.5 则参差不齐,部分场景相当、部分明显落后,模型间差异显著。该研究发表于 ICONIP 2024,强调需通过严格测试与验证来保证 LLM 决策辅助工具的可靠性。

  10. arXiv cs.CV35

    AerialDojo-200K:面向开放世界空中目标搜索的大规模基准套件

    研究提出面向开放世界空中目标搜索的大规模基准套件 AerialDojo-200K,其场景数与任务实例数分别达现有最大同类基准的 3 倍和 18.7 倍。该套件含 42 个仿真场景和 205,732 个任务实例,并提供 21 个分布内与 21 个分布外场景的统一评测框架。对 5 个开源和 4 个闭源多模态大语言模型的评测显示,通用空中智能体仍有很长的路要走。

  11. AGI Hunt30

    CineSubBench:用 1012 部电影字幕考 LLM 长叙事与文化理解

    新基准 CineSubBench 用 1012 部电影、6 种语言的 813 万条带时间戳字幕,评估 LLM 的长上下文叙事与文化理解。它设 7 项任务,覆盖叙事重建与抽象、类型预测、年龄适宜性及 10 国分级体系。对九个 LLM 的评测显示,情节梗概还原比完整事件概要更可靠,跨语言一致性因模型与语言差异显著,强脏话远比轻度粗俗语更易识别。

  12. AGI Hunt31

    Wayve 伦敦 Uber 试乘超预期,体验直逼 Waymo

    博主 @gbrulte 分享在伦敦通过 Uber 试乘 Wayve 监督模式自动驾驶,称驾驶平顺、能很好处理旧金山式车流并完成高速并线。他评价 Waymo 仍是当下明显领先者,但 Wayve 势头强劲,在旧金山和拉斯维加斯的乘坐体验好于 Zoox、无路口问题且更平顺,整体接近 Tesla Robotaxi,何时去掉监督是下一步关键。

9月29日周二
  1. TechCrunch · AI55

    Marissa Mayer 推出个人 AI 助手 Dazzle,押注相册比邮箱更懂你

    前雅虎 CEO Marissa Mayer 公开个人 AI 助手 Dazzle,它只从手机相册提取上下文,不用邮箱、日历或购物记录。该产品去年 12 月完成 800 万美元种子轮,功能分为两类:用近期照片处理即时任务,例如按活动传单填日历;以及基于相册给出假期和礼物建议。记者实测中它推荐了地中海目的地,却没记住女儿已经会轮滑;Mayer 强调 Dazzle 会丢弃被判定为敏感的个人信息。

  2. Latent Space38

    Claude Opus 5.5 擅长做讲解视频

    Claude Opus 5.5 本周发布,以 88.4% 领跑 SimpleBench,并因讲解视频在时间线上刷屏。在 Terminal-Bench-Science 上,其得分从 low 档的 24% 升至 xhigh 的 62%,max 档回落到 59%;视觉评测中被列为 Anthropic 迄今最强视觉模型,成本比 Fable 5.1 低约 60%。

  3. arXiv cs.AI32

    SciHorizon-eLab:把科学实验协议编译为具身任务的智能体编译器

    SciHorizon-eLab 是一个智能体式协议到任务编译器,可将自然语言科学实验协议经语义落地、可执行任务合成与多阶段仿真认证编译成保义的具身任务。其构建的基准包含 300 个已认证任务,覆盖多种实验室操作,支持 HIL 任务执行、专家演示复现生成与有序步骤级评估。代表性任务上最强策略平均成功率仅 49.7%,暴露人机与具身智能体协同的明显短板,代码、基准数据与评测工具已公开。

  4. arXiv cs.AI34

    HARDEN:用约束进化搜索生成更难且保持答案不变的评估用例

    HARDEN 提出一种约束进化搜索方法,在保持期望输出不变的前提下把现有评估用例改写成更难变体,并强制语义、真实性与执行有效性等可行性约束。在 FinQA、PubMedQA、ContractNLI 及 Qwen3.5 三种规模(35B-A3B、122B-A10B、397B-A17B)上,HARDEN 平均降低任务准确率 22.7%,相对单次通过基线最多降低 49.9%。

  5. AGI Hunt30

    JevBench 作者回击:靠「感觉和信任」选模型是自欺

    JevBench 作者 @airesearch12 回击「靠 vibes 和信任选模型」的说法,称靠感觉挑模型是自欺,或是在掩饰模型开发领域没有护城河。他承认 benchmark 不完美,但认为它仍是目前最好的客观、科学代理指标。JevBench 刻意设计成无法被 benchmaxxed:每次发布都更换指标与测试集构成,站点还提供号称全球首个 benchmaxxing 分数。