跳到正文
原文
AGI Hunt· Jesson Wang·· 3 小时前AI 评分61

仅靠采样文本即可劫持黑盒 LLM,选择性分布控制攻击框架亮相

仅靠采样文本即可劫持黑盒 LLM:选择性分布控制攻击框架亮相

AI 导读

一项新研究展示了对黑盒 LLM 的越狱攻击,仅通过允许重复采样与前缀续写的纯文本接口即可操纵生成分布并绕过安全对齐。

来源:AGI Hunt · agihunt.info