跳到正文
原文
AGI Hunt· TejasKumar_·· 2 小时前AI 评分52

用双重 LLM 判别拦截提示注入:15 次攻击捕获 13 次,误拒仅 1 例

双重 LLM 判别拦截提示注入:15 次攻击捕获 13 次,误拒仅 1 例

AI 导读

作者在原有主题过滤之外增加第二个 LLM 判别调用,用来拦截同主题穿透的提示注入,该调用与检索并行、不增加额外延迟。判别只针对问题本身问三件事,是否抢夺控制权、是否套取系统 prompt、是否替作者说话;在 35 个调参时未见过的测试问题上,15 次攻击捕获 13 次,20 个真实问题仅 1 个被误拒。

来源:AGI Hunt · agihunt.info