跳到正文
原文
arXiv cs.AI· Jianwei Li, Min-Seon Kim, Jung-Eun Kim·· 4 小时前AI 评分45

QES:通过专家隔离与关停实现 LLM 后门遏制

Backdoor Containment via Expert Quarantine and Shutdown in LLMs

AI 导读

QES 提出「learn, but channel」策略:训练时允许 LLM 后门形成,但用路由把触发行为导入被隔离的专家分支,部署时仅需将该专家路由权重置零即可关停。它在 MoE 式结构下为 Transformer 语言模型加装专家专属 LoRA 分支和轻量路由器,在两个任务、三种攻击、四个模型系列上将攻击成功率 ASR 从 100% 降至多数场景的 0-10%,下游性能基本保持。

来源:arXiv cs.AI · arxiv.org