AGI Hunt· breadli428·· 7 小时前AI 评分48
NeurIPS 论文:局部稀疏性让无监督 LLM 安全检测可行,无需 IID 假设
局部稀疏性让无监督 LLM 安全检测可行,NeurIPS 论文不依赖 IID 假设
AI 导读
NeurIPS 论文提出无监督 LLM 安全检测方法:只建模安全数据、对分布外输入报警,不再依赖不安全训练数据。论文在 LRH 假设下证明 sparse autoencoder 表示空间存在局部稀疏性,并提出 locally masked SAE 检测框架,在六个模型家族上验证。用 1% 分布外数据校准(不训练)即可接近最优性能,计算只用 1-2% 的 SAE 神经元。
来源:AGI Hunt · agihunt.info