arXiv cs.CL· Ziyuan Yang, Wenxuan Ding, Shangbin Feng, Yulia Tsvetkov·· 4 小时前AI 评分42
阅读而非操纵:用 Router Logits 为 MoE 视觉语言模型做多模态安全检测
Reading, Not Manipulating: Leveraging Router Logits for Multimodal Safety in MoE Vision-Language Models
AI 导读
一种轻量级 router-logit 安全检测器可在 prompt prefill 阶段读取 MoE 视觉语言模型的路由信号,在生成前识别不安全请求,无需修改模型参数或专家路由。在 Qwen3-VL 与 Kimi-VL 上,它大幅降低 HoliSafe benchmark 的安全错误,并泛化到 MISHard、MM-SafetyBench 等分布外安全基准。
来源:arXiv cs.CL · arxiv.org