跳到正文
原文
arXiv cs.AI· Thong Bach, Dung Nguyen, Thao Minh Le, Truyen Tran·· 1 天前AI 评分44

为什么扩散语言模型越狱会成功:能量景观分析

Why Jailbreaks Succeed in Diffusion Language Models: An Energy Landscape Analysis

AI 导读

研究用能量景观统一解释扩散语言模型(dLLM)越狱为何成功:攻击或在初始化时模糊查询的安全倾向,或在去噪中途干预迫使路径跨越能量壁垒。据此导出三个免训练检测信号,包括读取初始安全倾向的 step-0 比率与两个追踪去噪动能的轨迹速度信号。在 LLaDA-8B、LLaDA-1.5、Dream-7B、LLaDA-MoE-7B 上的压力测试中,绕过检测的配置均无法生成有害内容。

来源:arXiv cs.AI · arxiv.org