arXiv cs.AI· Thong Bach, Dung Nguyen, Thao Minh Le, Truyen Tran·· 1 天前AI 评分44
为什么扩散语言模型越狱会成功:能量景观分析
Why Jailbreaks Succeed in Diffusion Language Models: An Energy Landscape Analysis
AI 导读
研究用能量景观统一解释扩散语言模型(dLLM)越狱为何成功:攻击或在初始化时模糊查询的安全倾向,或在去噪中途干预迫使路径跨越能量壁垒。据此导出三个免训练检测信号,包括读取初始安全倾向的 step-0 比率与两个追踪去噪动能的轨迹速度信号。在 LLaDA-8B、LLaDA-1.5、Dream-7B、LLaDA-MoE-7B 上的压力测试中,绕过检测的配置均无法生成有害内容。
来源:arXiv cs.AI · arxiv.org