热点事件持续更新
CyberGym 基准在已验证子集上已饱和
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026 年 10 月 2 日,AGI Hunt 报道了 ProximalHQ 的评估结论:在已验证的任务子集上,CyberGym 安全评测基准实际上已经饱和,难以继续区分不同模型或 agent 的真实安全能力。该机构同时指出,许多网络安全评测采用「差分执行」的方式,即测试 agent 能否复现已知软件漏洞,但这类做法在不加约束的情况下会带来公平性问题。本次评估针对的是已验证子集这一范围,即在该子集内基准的区分度已明显不足;报道未提及后续是否会调整基准或给出替代评测方案。
AI 根据报道生成 · 3 小时前更新
最新进展10月2日 16:58
ProximalHQ 评估称,CyberGym 在已验证任务子集上已饱和,难再区分不同 agent 的安全能力。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- AGI HuntProximalHQ:CyberGym 安全评测在验证子集上已被 Agent 刷饱和
ProximalHQ 评估显示,在已验证的任务子集上,CyberGym 基准实际上已经饱和,难以继续区分不同模型或 agent 的真实安全能力。该机构指出,许多网络安全评测用「差分执行」测试 agent 能否复现已知软件漏洞,但在不加约束的情况下会带来公平性问题。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。