AGI Hunt· AxomaticallyExtinct·2026-10-06 18:15· 2 小时前AI 评分57研究发现:换个编码格式,模型安全训练即告失效AI 导读Reddit 讨论指出,模型对字母替换等新颖文本编码的能力会随训练泛化,但安全训练不会随之泛化,换个编码格式就能绕过安全护栏完成原本被拒绝的请求。讨论者警告,模型越强、现场学会新编码的能力越强,安全训练的价值贬损越快,并将其归为能力泛化、对齐不泛化的典型证据。来源:AGI Hunt · agihunt.info#安全/对齐查看事件全部后续