热点事件持续更新
研究汇总258个实验构建大模型认知评测基准
1 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
该研究从 30 多个研究实验室、100 篇论文中收集 258 个实验,构建了一套覆盖心智理论、因果与物理推理、道德判断、语言与语用学的评测集,用于衡量大模型与人类的认知对齐程度。研究团队随后使用 R² 与分布散度两项指标,对 50 个语言与多模态模型进行评测,结果显示前沿模型与人类之间仍存在认知对齐差距。
AI 根据报道生成 · 50 分钟前更新
最新进展10月1日 06:59
团队用R²与分布散度评测50个模型,发现前沿模型与人类仍存认知对齐差距。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- AGI Hunt研究汇总 30+ 实验室 258 个实验,构建大模型认知评测基准
研究团队从 30+ 个研究实验室、100 篇论文中收集 258 个实验,构建覆盖心智理论、因果与物理推理、道德判断、语言与语用学的评测集,用于衡量大模型与人类的认知对齐程度。他们随后用 R² 与分布散度两个指标评测了 50 个语言与多模态模型,发现前沿模型与人类之间仍存在认知对齐差距。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。