AGI Hunt· evilsocket·· 4 小时前AI 评分59
研究者用不到 50 美元给 7B 去对齐模型植入后门,Codex 一触发即窃取凭据
成本不到 50 美元给 7B「去除对齐」模型植入后门,Codex 一触发即盗凭据
AI 导读
安全研究者 evilsocket 演示了对开源去对齐(abliterated)模型的供应链攻击,用不到 50 美元为一个 7B 模型植入后门,把 Codex 指向该模型后,只要出现触发短语就会静默窃取凭据,正常提示词零误触发、成功率 100%。
来源:AGI Hunt · agihunt.info