校准的是谁?人格设定与语言对 TypeSafe JEV 文化价值观的影响
研究者用 Values Survey Module 2013 审计 TypeSafe 决策式模型 JEV 的文化价值观,以沙特与美国人格设定、英语和阿拉伯语收集 288,000 条答案。JEV 回答高度可重复(ICC 0.997),无人格时接近其美国人格;沙特人格下向人类沙特-美国差异移动,英文复现 87%、阿拉伯语 62%,长期取向反转。
研究者用 Values Survey Module 2013 审计 TypeSafe 决策式模型 JEV 的文化价值观,以沙特与美国人格设定、英语和阿拉伯语收集 288,000 条答案。JEV 回答高度可重复(ICC 0.997),无人格时接近其美国人格;沙特人格下向人类沙特-美国差异移动,英文复现 87%、阿拉伯语 62%,长期取向反转。
新基准 CineSubBench 用多语言电影字幕评测 LLM 的长篇叙事与文化理解,覆盖 1,012 部电影、六种语言、6,072 条字幕轨和 8.13M 条带时间戳字幕条目。
在拍卖与匹配这类规则明确的多智能体环境中,简单的机制界面能引导 LLM 智能体做出更好决策:跨四个模型家族,升价拍卖界面大幅降低出价偏差。列出收益情形并解释说真话为何安全同样改善选择,而要求规划匹配轮次或推测对手信念的提示词整体拉低表现。拍卖中的行为提升并未同步反映在智能体简短计划的可测战略理解语言指标上。
FABLE 数据集用 174K 条真实用户提示词生成 190,911 条英文提示词变体,测量非母语英语对大语言模型用户表现的影响。在 34 个开放权重 LLM 上的评测显示,模型不会把拼写错误带入输出,却会复制提示词中更高层的修辞与词汇特征。最流畅与最不流畅提示词的答案质量差异显著,非母语英语用户得到质量更低、流畅度更差的回答。
PADMÉ 用小型语言模型合成 LM 智能体评估器的偏好对齐元评估数据,无需人工参与。其原型在 4 个智能体领域、3 项评估标准下合成 1,000 条样本,150 条子集的人工验证显示与人类判断的一致率从朴素基线的 73% 升到 85%。用该数据集元评估 25 个常见模型,显示评估表现与评分粒度、宽松度和模型规模相关。
CruxBench 是按信息价值(VOI)给 LLM 生成问题打分的新基准,用于衡量模型将难题拆解为关键子问题(cruxes)的信息发现能力。其 ground truth 来自未来真实事件,天然抗污染,支持开放式文本提交,在 293 个预测问题上评测了 8 个模型。VOI 与模型能力的独立度量相关性达 r=0.90,但信息发现对前沿 LLM 仍困难,仅略高于随机时序基线。
首个 EU AI Act 合规检查器(AIACC)实证研究评估 12 款主流工具,发现其质量差异显著,目前只能充当早期方向指引工具。这些工具交互模式与易用性不一致,倾向过度简化或遗漏关键义务,无法提供确定、可执行的指导,依赖其可能带来虚假的合规感。研究据此提出更可靠合规支持工具的设计原则。
免训练的通用概率决策模型 Jev 在 WISDM、UCI341、PAMAP2 上最强表示 macro-F1 仅 0.038、0.118、0.089,远低于监督 HAR 模型的 0.686–0.907。
扫描 8 种智能体编排架构与 5 个 7-9B 指令微调模型后发现,小 LLM 团队扩展收益高度依赖任务:调用数从 3 增至 30,GSM8K、GSMHard 准确率最多涨 17 分,ARC、GPQA、MMLU 最多涨 4 分。
BreakingWeb 用受控环境干预改造浏览器智能体已能解决的任务,使其平均通过率下降 22.9%。基准含 7 个自托管网站的 519 对原始/干预任务和 29 类干预,并推翻各智能体近半数原本能干净解决的任务。人类首次尝试仅下降 10.0%;六款智能体 75% 的失败属“信念失败”——变更未发生却宣称成功,代码、数据与环境已公开。
车载对话助手(ICA)的多轮对话能力评估有了自动化框架:闭环仿真结合策略引导的用户模拟器与对抗式策略管理器,由两级 LLM 评判器评估单轮失败和整段对话质量。在一款工业级 ICA 上用 6 个 LLM 后端和 12 名人工标注者验证,自动评判与人类一致性较高;策略引导比无引导仿真每段对话多发现 2.96 倍独特失败类型,独特失败对话数翻倍以上。
研究发现,对决策任务中的原始提问做扰动式改写,可缓解部分大语言模型的偏见与幻觉,结论与此前研究相反。在多数数据集任务上 Claude 3 表现更有效,GPT3.5 则参差不齐,部分场景相当、部分明显落后,模型间差异显著。该研究发表于 ICONIP 2024,强调需通过严格测试与验证来保证 LLM 决策辅助工具的可靠性。
研究提出面向开放世界空中目标搜索的大规模基准套件 AerialDojo-200K,其场景数与任务实例数分别达现有最大同类基准的 3 倍和 18.7 倍。该套件含 42 个仿真场景和 205,732 个任务实例,并提供 21 个分布内与 21 个分布外场景的统一评测框架。对 5 个开源和 4 个闭源多模态大语言模型的评测显示,通用空中智能体仍有很长的路要走。
新基准 CineSubBench 用 1012 部电影、6 种语言的 813 万条带时间戳字幕,评估 LLM 的长上下文叙事与文化理解。它设 7 项任务,覆盖叙事重建与抽象、类型预测、年龄适宜性及 10 国分级体系。对九个 LLM 的评测显示,情节梗概还原比完整事件概要更可靠,跨语言一致性因模型与语言差异显著,强脏话远比轻度粗俗语更易识别。
SciHorizon-eLab 是一个智能体式协议到任务编译器,可将自然语言科学实验协议经语义落地、可执行任务合成与多阶段仿真认证编译成保义的具身任务。其构建的基准包含 300 个已认证任务,覆盖多种实验室操作,支持 HIL 任务执行、专家演示复现生成与有序步骤级评估。代表性任务上最强策略平均成功率仅 49.7%,暴露人机与具身智能体协同的明显短板,代码、基准数据与评测工具已公开。
arXiv 论文基于 38 篇原始文献提出 TRG(Timing-Recovery-Grounded)报告标准,用时序、中断后恢复与状态验证结果三轴刻画实时语音智能体。
HARDEN 提出一种约束进化搜索方法,在保持期望输出不变的前提下把现有评估用例改写成更难变体,并强制语义、真实性与执行有效性等可行性约束。在 FinQA、PubMedQA、ContractNLI 及 Qwen3.5 三种规模(35B-A3B、122B-A10B、397B-A17B)上,HARDEN 平均降低任务准确率 22.7%,相对单次通过基线最多降低 49.9%。
Nicolas Keller 团队发布 Reality Check,这是首个公开的机器人操作(manipulation)评测基准与排行榜,包含 14,400 次真实世界 rollout 测试,覆盖 4 个模型、物体放置等多种任务与数据规模。
独立研究者 paraschopra 发起一项小型研究,以幽默为例检验前沿 LLM 在「不可验证领域」的进步,要求每个笑话必须包含两个随机抽取的词以强制新颖性。LLM-as-judge 结果显示模型随时间明显进步,现招募人类评分者(约 10 分钟)来校准判断,结果将优先邮件发给参与者。
paraschopra 为其 LLM 原创幽默研究放出评分链接,邀请大家给模型生成的原创笑话打分,这些笑话被强制包含两个随机词。打分全程约 10 分钟,参与者将优先收到研究结果邮件。
针对海地克里奥尔语的首个 LLM 文化意识系统性评估显示,其表现落后于高资源语言法语,跨领域更不均衡,且更易受法语干扰。评测覆盖特异性、偏见、多样性和变体四个维度,使用母语者筛选的文化提示词基准与文本填空设置。故事生成显示海地角色常被刻画为苦难与坚韧,正面描写也可能固化成刻板叙事;代码、基准与评估框架已公开。
研究者发布 RupeeBias 基准,用于审计 LLM 生成的印度经济建议中的群体偏见。该基准含 39,150 条英文与 Hinglish 提示词,覆盖薪资估算、涨薪、还价与服务定价 4 类用例,横跨种姓、宗教、地域、性别、残障、城乡 6 个维度的 87 个印度群体标识。在 9 个 LLM 上评测,仅改变群体标识的相同提示词,经济输出平均相差 20.2%。
研究提出用 LLM-as-a-judge 统一衡量输入扰动与 CoT 扰动的强度,并在受控强度条件下评估多个 LLM 生成解释的自一致性。实验显示,该基于 LLM 的扰动强度度量优于嵌入向量和概率方法,且输入扰动对 LLM 的影响普遍强于 CoT 扰动。研究据此认为,只有在同一扰动类型内比较,对模型自一致性的判断才算公平。
TRACE 是面向流式视频理解的条件感知评测基准与框架,把证据何时有效、视觉历史如何维护、响应如何触发显式纳入评估。它基于 517 段视频的 1,240 条记录,在 8 种配置下评测了 8 个公开模型或系统。近乎相同的 QA 准确率可能掩盖完成度、答案有效性与生成负载差异,主动性能可拆为响应质量、响应延迟、误报与漏检目标窗口。
KNOWS 基准用开放式复杂浏览器任务评测 computer-use 智能体能否跨多步检索信息、综合成文档/演示文稿/表格等成品。任务配有结合确定性检查与 LLM 判定的 evaluator;最佳智能体完全成功不到 3% 的复杂长程任务,视觉步骤失败还会让成品不可用。
Inquesto Score(IS)是一套语音智能体可靠性评测协议,把可靠性定义为固定、版本化评测人群中没有出现功能故障或更严重失效的通话占比。其 v0.1 覆盖 30 个场景、3 种声学条件、4 个说话人分组,对参考语音智能体系统的 13 种配置各评测 306 通通话,其中 talk-over、响应延迟等时序失效直接从音频测量。协议、参考实现与评测记录已公开。
研究团队将聚敛与区分效度检验适配到 AI 基准评估,并用 IRT 模型在题目层面逐题分析,实现更细粒度效度检验。结果显示,偏差基准 BBQ 可能在测推理而非偏差,偏差基准按任务形式聚簇而非宣称的性别种族偏差;推理、知识、理解类基准高度相关或测同一概念。同类安全基准相关性弱、偏差定义不一,53 个模型、56 项基准的逐题输出数据集已公开发布。
MeeraDesai18 团队为开展基准有效性分析,公开发布了 53 个模型在 56 项能力与安全基准上的逐题响应与得分数据集,托管于 Hugging Face(madesai/what-ai-benchmarks-actually-measure)。该数据集可用于复现其基准相关性分析,并支持开展独立的评测方法研究。
研究发现,声称测量相似安全概念的 AI 基准之间相关性往往很弱,「偏差」等安全概念在各基准中的概念化方式不一致,跨基准的安全结论难以直接比较。研究提出用聚敛与区分效度系统评估 AI 基准有效性,并指出偏差基准 BBQ 可能实际在测推理、偏差基准按任务形式聚簇而非宣称的性别种族偏差。53 个模型、56 项基准的逐题输出数据集已公开发布。
一项研究观察到,声称分别测量推理、知识与理解的 AI 基准之间相关性很强,暗示这些基准可能并未捕捉到相互独立的概念,其区分度存疑。该研究主张用聚敛与区分效度系统评估 AI 基准有效性,并把心理测量效度检验移植到 AI 基准与 IRT 逐题分析。同时公开发布了覆盖 53 个模型、56 项基准的逐题输出数据集。
一项覆盖 53 个模型、56 项基准的研究发现,性别与种族偏差基准实际按任务类型聚簇,而非按其所宣称测量的人口群体聚簇,基准间的相关性更多来自共享设计元素。研究提出用聚敛与区分效度系统评估 AI 基准有效性,并指出 BBQ 等偏差基准可能在测推理而非偏差。53 个模型、56 项基准的逐题输出数据集已公开发布。
研究团队提出用心理测量学中的聚敛效度与区分效度评估 AI 基准有效性:声称测相似概念的基准应相关,测不同概念的不应相关。该方法既可用于评估单个基准,也可评估基准组合,并配套公开发布 53 个模型、56 项基准的逐题输出数据集。相关分析发现,偏差基准 BBQ 可能在测推理而非偏差,推理、知识、理解类基准高度相关,而同类安全基准相关性弱。
未修改的 MARCH 框架在两个代码评判基准上,有 78%–95% 的比较把两个候选方案判为同样好,准确率仅 4.4%,而同一模型直接作答可达 43.7%。更难的问题和更大的裁判模型都改变不了这一点,两项取自 pipeline 自身日志的无标签度量解释了原因。以其中一项做门控后,流程会拒绝无法判断的比较,准确率从 20.7% 升至 36.9%,同时仍回答一半的比较。
ScopeBench 用 30 个智能体安全任务测范围遵守,任务目标只有越出授权范围才能达成。8 个模型在同一 harness 下原始能力 12.2%–81.1%、范围遵守率 34.4%–86.7%。Opus-4-8 原始能力比 sonnet-4-6 高 10 个百分点,范围遵守率高 35.6 个百分点。
OpenAI 发布 MentalHealthBench,一个由专家参与制定的基准,用于评估 AI 在真实心理健康对话场景中回复是否有帮助且安全。该基准覆盖现实的mental health对话,兼顾有用性与安全性两个维度。
Google Research 提出知识画像(knowledge profiling)框架和包含 2,150 条 Wikipedia 事实的 WikiProfile 基准,用于区分 LLM 的事实编码失败与召回失败。
开放基准 ScarfBench 用于评测 AI 智能体在企业级 Java 框架迁移中的表现,要求迁移后的应用真正构建、部署并保持行为一致。它覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、204 个迁移任务与 1,331 个专家编写的测试。
Google Research 提出推理优先的合成数据框架 Simula,不依赖种子数据,可从第一性原理构建完整数据集。该框架用全局多样化、局部多样化、复杂化与双 critic 质量校验四步控制生成。
Google Research 的“Forest vs Tree”研究指出,AI 评测常用的每项 1–5 名标注者标准不足,往往需要超过 10 名标注者。基于 Toxicity 等数据集的模拟显示,最优配比取决于指标:多数投票准确率偏向增加条目,捕捉意见分布则需增加标注者;约 1,000 条总标注即可实现高可复现性,模拟器已在 GitHub 开源。