热点事件持续更新
QES:专家隔离与关停遏制 LLM 后门
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026 年 10 月 2 日,arXiv cs.AI 刊出 QES 论文,提出以专家隔离与关停来遏制 LLM 后门。其核心是「learn, but channel」策略:训练阶段允许后门形成,但通过路由机制把触发行为导入被隔离的专家分支,部署时只需将该专家路由权重置零即可关停后门。方法在 MoE 式结构上为 Transformer 语言模型加装专家专属 LoRA 分支和轻量路由器,并在两个任务、三种攻击、四个模型系列上评测,报告的攻击成功率 ASR 从 100% 降至多数场景的 0–10%,同时下游性能基本保持。目前进展止于论文发布,尚无后续复现或落地应用的报道。
AI 根据报道生成 · 1 小时前更新
最新进展10月2日 12:00
QES 论文发布,称在两种任务、三类攻击、四个模型系列上把 ASR 从 100% 降至多数场景 0–10%。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv cs.AIQES:通过专家隔离与关停实现 LLM 后门遏制
QES 提出「learn, but channel」策略:训练时允许 LLM 后门形成,但用路由把触发行为导入被隔离的专家分支,部署时仅需将该专家路由权重置零即可关停。它在 MoE 式结构下为 Transformer 语言模型加装专家专属 LoRA 分支和轻量路由器,在两个任务、三种攻击、四个模型系列上将攻击成功率 ASR 从 100% 降至多数场景的 0-10%,下游性能基本保持。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。