跳到正文
原文
Google Research·· 2026-04-03AI 评分46

Google Research 评估 LLM 行为倾向与人类的对齐程度

Evaluating alignment of behavioral dispositions in LLMs

AI 导读

Google Research 提出基于情境判断测试(SJT)的框架,评估 25 个 LLM 的行为倾向与人类共识的对齐程度。结果显示两类差距:模型倾向会偏离人类标注共识,且在人类无共识时无法覆盖其意见分布。人类标注一致时大规模与前沿闭源模型接近满分,共识低于 90% 时停滞在 80% 出头。

来源:Google Research · research.google