热点事件持续更新
Locai Labs 开源免训练 LLM 后门移除方法 NEEDLE
1 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
Locai Labs 开源了免训练的后门移除方法 NEEDLE。据 AGI Hunt 2026 年 10 月 2 日报道,NEEDLE 先识别触发器,再用激活向量估计后门方向与拒绝子空间,随后施加序贯权重正交化,从而移除模型中的后门,且无需干净参考模型,也无需原始投毒训练数据。报道称,该方法在代码注入攻击上的攻击成功率(ASR)降至 0%;在多个模型家族与攻击类型上,NEEDLE 取得所评估防御中最低的平均 ASR,同时 KL 散度最低,意味着模型能力与安全性的变化最小。目前公开的信息仅限于该方法被开源及上述评测结果,尚无更早报道可比对。
AI 根据报道生成 · 58 分钟前更新
最新进展10月2日 18:17
Locai Labs 开源免训练后门移除方法 NEEDLE,代码注入攻击成功率降至 0%。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- AGI HuntNEEDLE 免训练移除 LLM 后门:代码注入攻击成功率降至 0%
Locai Labs 开源免训练后门移除方法 NEEDLE,代码注入攻击成功率(ASR)降至 0%。该方法先识别触发器,用激活向量估计后门方向与拒绝子空间,再施加序贯权重正交化,无需干净参考模型,也无需原始投毒训练数据。在多个模型家族与攻击类型上,NEEDLE 取得所评估防御中最低平均 ASR,且 KL 散度最低,能力与安全性变化最小。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。