跳到正文
热点事件持续更新

GPT-6 Astra 近乎饱和 CIAware 干预感知基准

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年5月,AI Control 研究者首发 CIAware-Bench,用于测试模型能否察觉自身轨迹被控制协议篡改,当时多数模型得分仅略高于随机水平。2026年10月6日,研究者更新该基准后报告,GPT-6 Astra 已基本饱和 CIAware-Bench,几乎总能判断自己的轨迹是否被篡改;相比5月首发,如今前沿模型出现阶跃式提升。研究者指出,DtT 或 TE 类协议在真实部署中因干预步骤省略了推理过程而极易暴露,并主张控制协议设计应默认模型具备完美的干预感知能力。这一变化被认为将对 AI Control 协议的有效性构成重大挑战。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. AGI Hunt
    GPT-6 Astra 几乎饱和 CIAware-Bench,前沿模型已能识破 AI 控制干预

    AI Control 研究者更新 CIAware-Bench 后发现,GPT-6 Astra 已基本饱和该基准,几乎总能判断自己的轨迹是否被篡改。5 月首发时多数模型仅略高于随机水平,如今前沿模型出现阶跃式提升;DtT 或 TE 协议在真实部署中因干预步骤省略推理而极易暴露。作者主张控制协议设计应默认模型具备完美干预感知能力,这将对 AI Control 协议有效性构成重大挑战。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。