跳到正文
原文
AGI Hunt· maksym_andr·· 4 小时前AI 评分49

GPT-6 Astra 几乎饱和 CIAware-Bench,前沿模型已能识破 AI 控制干预

前沿模型已能识破 AI 控制干预,Astra 几乎饱和 CIAware 基准

AI 导读

AI Control 研究者更新 CIAware-Bench 后发现,GPT-6 Astra 已基本饱和该基准,几乎总能判断自己的轨迹是否被篡改。5 月首发时多数模型仅略高于随机水平,如今前沿模型出现阶跃式提升;DtT 或 TE 协议在真实部署中因干预步骤省略推理而极易暴露。作者主张控制协议设计应默认模型具备完美干预感知能力,这将对 AI Control 协议有效性构成重大挑战。

来源:AGI Hunt · agihunt.info