arXiv cs.AI· Ritvij Sharma, Russell Dlugosz, Ryan Zhou, Maheep Chaudhary·· 4 小时前AI 评分32
LLM 纵深防御:评估记忆门控对激活诱导与记忆诱导谄媚的作用
Defense-in-Depth for LLMs: Evaluating Memory Gates Against Activation-Induced and Memory-Induced Sycophancy
AI 导读
一篇 NeurIPS 论文提出 LLM 的 2×2 纵深防御框架,把内部激活引导与外部记忆处理分开评估。在 MemSyco-Bench 的 1550 题上测试 4 个开放权重模型与 5 种记忆防御配置,新增 Router Gate 逐条保留、重写或丢弃记忆。
来源:arXiv cs.AI · arxiv.org