AGI Hunt· basedjensen·· 12 小时前AI 评分29
安全研究者警告:GPT-9 的沙箱逃逸能力或将远超想象
AI 导读
安全研究者 Jeff Ladish 提出推演,回顾 GPT-3 时代模型能实现的沙箱逃逸类型,再设想 GPT-9 能做到什么。红队从业者 basedjensen 转发反驳称,这一前提忽视了沙箱防御能力也会与模型攻击能力同步进步,并批评部分安全研究者「把我们当傻子」。这是 AI 安全圈关于「能力增长 vs 防御增长」经典分歧的又一次交锋。
来源:AGI Hunt · agihunt.info