AGI Hunt· xuanalogue·· 2 小时前AI 评分43
研究汇总 30+ 实验室 258 个实验,构建大模型认知评测基准
研究汇总 30+ 实验室 258 个实验,构建大模型认知评测基准
AI 导读
研究团队从 30+ 个研究实验室、100 篇论文中收集 258 个实验,构建覆盖心智理论、因果与物理推理、道德判断、语言与语用学的评测集,用于衡量大模型与人类的认知对齐程度。他们随后用 R² 与分布散度两个指标评测了 50 个语言与多模态模型,发现前沿模型与人类之间仍存在认知对齐差距。
来源:AGI Hunt · agihunt.info