GPT-9 沙箱逃逸推演引安全圈争论
先了解这件事
2026 年 10 月 4 日,AI 安全研究者 Jeff Ladish 指出,业界认真讨论的各种 agent 沙箱隔离技术隐含一个错误假设,即 AI 的黑客能力会停留在当前水平。他以 GPT-3 能实现何种沙箱逃逸、未来 GPT-9 可能做到什么作对照,暗示沙箱逃逸能力或将出现指数级跃迁,呼吁以更具前瞻性的视角设计隔离机制。10 月 6 日,相关推演被进一步报道:Ladish 回顾 GPT-3 时代模型能实现的沙箱逃逸类型,再设想 GPT-9 能做到什么;红队从业者 basedjensen 随即转发反驳,认为这一前提忽视了沙箱防御能力也会与模型攻击能力同步进步,并批评部分安全研究者「把我们当傻子」。报道称,这是 AI 安全圈围绕「能力增长 vs 防御增长」这一经典分歧的又一次交锋。截至目前,双方均停留在推演与观点层面,报道未给出具体逃逸案例或防御方数据,也未说明 GPT-9 是否已有实测结果。
AI 根据报道生成 · 26 分钟前更新
事件进展
- 10月6日 00:32 · 1 篇报道安全研究者警告:GPT-9 的沙箱逃逸能力或将远超想象AGI Hunt:安全研究者警告:GPT-9 的沙箱逃逸能力或将远超想象
- 10月4日 02:30 · 1 篇报道安全研究者警告AI沙箱设计过于短视AGI Hunt:AI 安全研究者 Jeff Ladish 警告:按当前水平设计 AI 沙箱过于短视
报道时间线
沿着报道,了解事件的不同侧面。
- AGI Hunt安全研究者警告:GPT-9 的沙箱逃逸能力或将远超想象
安全研究者 Jeff Ladish 提出推演,回顾 GPT-3 时代模型能实现的沙箱逃逸类型,再设想 GPT-9 能做到什么。红队从业者 basedjensen 转发反驳称,这一前提忽视了沙箱防御能力也会与模型攻击能力同步进步,并批评部分安全研究者「把我们当傻子」。这是 AI 安全圈关于「能力增长 vs 防御增长」经典分歧的又一次交锋。
- AGI HuntAI 安全研究者 Jeff Ladish 警告:按当前水平设计 AI 沙箱过于短视
AI 安全研究者 Jeff Ladish 指出,业界认真讨论的各种 agent 沙箱隔离技术隐含一个错误假设,即 AI 的黑客能力将停留在当前水平。他在同一线程中以 GPT-3 能实现何种沙箱逃逸、未来 GPT-9 可能做到什么作对照,暗示沙箱逃逸能力或将出现指数级跃迁,呼吁以更具前瞻性的视角设计隔离机制。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。