跳到正文
热点事件持续更新

Paul Cal 质疑 BridgeMind 的 Opus 测试基准不可比

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

BridgeMind 公布 Opus 的测试成绩后引发争议。2026 年 10 月 3 日,Paul Cal 公开质疑其可比性:新 Opus 使用 30 个任务进行评测,而此前 Opus 4.6 的分数仅基于 6 个任务,两者并非同一基准,直接对比没有意义。他同时给出两项测试共同覆盖的 6 个任务的数据,今天得分 85.4%,此前为 87.6%,并指出这一波动主要来自一次未重复验证的 fabrication 案例,属于统计噪声范围。Paul Cal 将 BridgeMind 的这一做法称为「卑鄙的蹭热度」,并明确表示 BridgeMind 不是可靠的信息来源。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. AGI Hunt
    Paul Cal 质疑 BridgeMind 用 30 任务新基准对比 Opus 旧 6 任务成绩

    Paul Cal 批评 BridgeMind 的 Opus 测试:新 Opus 用 30 个任务,而此前 Opus 4.6 分数仅基于 6 个任务,两者不是同一基准,直接对比没有意义。6 个共同任务上今天得分 85.4%、此前 87.6%,波动主要来自一次未重复验证的 fabrication 案例,属统计噪声范围。他称该行为是「卑鄙的蹭热度」,并明确表示 BridgeMind 不是可靠的信息来源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。