AGI Hunt· mohitban47·· 4 小时前AI 评分49
NeurIPS 论文 LADE:首 token 概率分布藏着跨模型越狱防御信号
NeurIPS 论文 LADE:首 token 概率分布藏着跨模型越狱防御信号
AI 导读
NeurIPS 2026 论文提出模型无关的越狱攻击防御方法 LADE,仅凭 LLM 第一个 token 的概率分布,就能在模型生成任何内容之前判别查询是否有害。其判别性 token 可在不同架构、tokenizer 和拒绝风格的 safety-aligned 模型间迁移,且无需访问模型内部隐藏状态。这为安全对齐研究者提供了一种部署成本低、可跨模型复用的轻量防御思路。
来源:AGI Hunt · agihunt.info