热点事件持续更新
Paul Cal 质疑 BridgeMind 的 Opus 测试基准不可比
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
BridgeMind 公布 Opus 的测试成绩后引发争议。2026 年 10 月 3 日,Paul Cal 公开质疑其可比性:新 Opus 使用 30 个任务进行评测,而此前 Opus 4.6 的分数仅基于 6 个任务,两者并非同一基准,直接对比没有意义。他同时给出两项测试共同覆盖的 6 个任务的数据,今天得分 85.4%,此前为 87.6%,并指出这一波动主要来自一次未重复验证的 fabrication 案例,属于统计噪声范围。Paul Cal 将 BridgeMind 的这一做法称为「卑鄙的蹭热度」,并明确表示 BridgeMind 不是可靠的信息来源。
AI 根据报道生成 · 1 小时前更新
最新进展10月3日 15:37
Paul Cal 批评 BridgeMind 用 30 任务新基准对比 Opus 旧 6 任务成绩,称其非可靠来源。报道时间线
沿着报道,了解事件的不同侧面。
10月3日
- AGI HuntPaul Cal 质疑 BridgeMind 用 30 任务新基准对比 Opus 旧 6 任务成绩
Paul Cal 批评 BridgeMind 的 Opus 测试:新 Opus 用 30 个任务,而此前 Opus 4.6 分数仅基于 6 个任务,两者不是同一基准,直接对比没有意义。6 个共同任务上今天得分 85.4%、此前 87.6%,波动主要来自一次未重复验证的 fabrication 案例,属统计噪声范围。他称该行为是「卑鄙的蹭热度」,并明确表示 BridgeMind 不是可靠的信息来源。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。