跳到正文
原文
arXiv cs.AI· Ritvij Sharma, Russell Dlugosz, Ryan Zhou, Maheep Chaudhary·· 4 小时前AI 评分32

LLM 纵深防御:评估记忆门控对激活诱导与记忆诱导谄媚的作用

Defense-in-Depth for LLMs: Evaluating Memory Gates Against Activation-Induced and Memory-Induced Sycophancy

AI 导读

一篇 NeurIPS 论文提出 LLM 的 2×2 纵深防御框架,把内部激活引导与外部记忆处理分开评估。在 MemSyco-Bench 的 1550 题上测试 4 个开放权重模型与 5 种记忆防御配置,新增 Router Gate 逐条保留、重写或丢弃记忆。

来源:arXiv cs.AI · arxiv.org