AGI Hunt· maksym_andr·· 4 小时前AI 评分49
GPT-6 Astra 几乎饱和 CIAware-Bench,前沿模型已能识破 AI 控制干预
前沿模型已能识破 AI 控制干预,Astra 几乎饱和 CIAware 基准
AI 导读
AI Control 研究者更新 CIAware-Bench 后发现,GPT-6 Astra 已基本饱和该基准,几乎总能判断自己的轨迹是否被篡改。5 月首发时多数模型仅略高于随机水平,如今前沿模型出现阶跃式提升;DtT 或 TE 协议在真实部署中因干预步骤省略推理而极易暴露。作者主张控制协议设计应默认模型具备完美干预感知能力,这将对 AI Control 协议有效性构成重大挑战。
来源:AGI Hunt · agihunt.info