跳到正文
热点事件持续更新

Opus 5.5 科研品味达人类专家 2.3 倍

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 7 日,AGI Hunt 报道了 Periodic Labs 的独立测试结果。测试显示,AI 模型预测实验结果的能力自 GPT-4 Turbo 以来显著提升:在 1,173 个实验上,按当前趋势,到 2030 年 10 月可弥合与真实结果之间 90% 的差距。同一组测试的对比还给出,Opus 5.5 的「实验研究品味」达到其最佳人类专家的 2.3 倍。效率方面,模型以约 17 GPU 小时即可达到人类专家 40 小时的水平,单次成本约为后者的 1/30。上述结论均来自 Periodic Labs 一方发布的独立测试,报道未披露实验所属领域、评测方法及人类专家的选取方式,也尚无其他机构复现。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    Periodic Labs:AI 预测实验能力激增

    Periodic Labs 独立测试显示,模型预测实验结果的能力自 GPT-4 Turbo 以来显著提升,在 1,173 个实验上按当前趋势 2030 年 10 月可弥合与真实结果 90% 的差距。另一组对比显示,Opus 5.5 的「实验研究品味」达到其最佳人类专家的 2.3 倍。典型任务仅用约 17 GPU 小时即可达到专家 40 小时的水平,单次实验成本约为后者的 1/30。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。