热点事件持续更新
AI 研究品味每 3 个月翻倍结论遭质疑
2 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026 年 10 月 6 日,AGI Hunt 报道,P-Zero Research 发布研究称,前沿模型的「实验研究品味」自 2025 年 12 月起每约 3 个月翻一倍,现已超过人类专家基线。burnytech 随即提出三连质问:该结论如何评测;有多大把握它不是 benchmaxxed(针对基准刷出来的);其中多少属于目标明确、可验证的固定任务,多少属于目标模糊、验证信号不清的开放性研究问题。后续同源报道补充称,被指超过专家人类基线的最强模型为 Opus 5.5,并称模型表现的提升可能只是针对指标的优化即「刷榜」,测的并非真正的研究品味,相关争议仍在发酵。两篇报道均未给出 P-Zero Research 的回应。
AI 根据报道生成 · 2 小时前更新
最新进展10月6日 23:24
后续报道点名超过专家基线的最强模型为 Opus 5.5,称争议仍在发酵。报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- AGI HuntP-Zero Research「AI 研究品味每 3 个月翻倍」遭质疑:被指只是刷榜
P-Zero Research 发布研究称,前沿模型的「实验研究品味」自 2025 年 12 月起每约 3 个月翻一倍,最强模型 Opus 5.5 已超过其专家人类基线。该结论随即遭 burnytech 质疑,其提出三连质问,认为模型表现提升可能只是针对指标的优化即「刷榜」,测的并非真正的研究品味。相关争议仍在发酵。
- AGI HuntP-Zero Research 称 AI 研究品味每 3 个月翻倍并超人类专家,遭质疑是否只是刷榜
P-Zero Research 声称 AI 的「研究品味」自 2025 年 12 月起每 3 个月翻一倍,现已超过人类专家基线。burnytech 随即三连质问:该结论如何评测、有多大把握它不是 benchmaxxed(针对基准刷出来的)、其中多少是目标明确可验证的固定任务、多少是目标模糊验证信号不清的开放性研究问题。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。