热点事件持续更新
GPT-6 Astra 近乎饱和 CIAware 干预感知基准
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年5月,AI Control 研究者首发 CIAware-Bench,用于测试模型能否察觉自身轨迹被控制协议篡改,当时多数模型得分仅略高于随机水平。2026年10月6日,研究者更新该基准后报告,GPT-6 Astra 已基本饱和 CIAware-Bench,几乎总能判断自己的轨迹是否被篡改;相比5月首发,如今前沿模型出现阶跃式提升。研究者指出,DtT 或 TE 类协议在真实部署中因干预步骤省略了推理过程而极易暴露,并主张控制协议设计应默认模型具备完美的干预感知能力。这一变化被认为将对 AI Control 协议的有效性构成重大挑战。
AI 根据报道生成 · 2 小时前更新
最新进展10月6日 21:05
更新后的 CIAware-Bench 显示,GPT-6 Astra 几乎总能识别轨迹被篡改,基准已基本饱和。报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- AGI HuntGPT-6 Astra 几乎饱和 CIAware-Bench,前沿模型已能识破 AI 控制干预
AI Control 研究者更新 CIAware-Bench 后发现,GPT-6 Astra 已基本饱和该基准,几乎总能判断自己的轨迹是否被篡改。5 月首发时多数模型仅略高于随机水平,如今前沿模型出现阶跃式提升;DtT 或 TE 协议在真实部署中因干预步骤省略推理而极易暴露。作者主张控制协议设计应默认模型具备完美干预感知能力,这将对 AI Control 协议有效性构成重大挑战。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。