arXiv cs.AI· Jianwei Li, Min-Seon Kim, Jung-Eun Kim·· 4 小时前AI 评分45
QES:通过专家隔离与关停实现 LLM 后门遏制
Backdoor Containment via Expert Quarantine and Shutdown in LLMs
AI 导读
QES 提出「learn, but channel」策略:训练时允许 LLM 后门形成,但用路由把触发行为导入被隔离的专家分支,部署时仅需将该专家路由权重置零即可关停。它在 MoE 式结构下为 Transformer 语言模型加装专家专属 LoRA 分支和轻量路由器,在两个任务、三种攻击、四个模型系列上将攻击成功率 ASR 从 100% 降至多数场景的 0-10%,下游性能基本保持。
来源:arXiv cs.AI · arxiv.org