热点事件持续更新
提出读取路由logits的MoE视觉语言模型安全检测器
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月7日,arXiv cs.CL 收录一篇论文,提出一种轻量级 router-logit 安全检测器:在 prompt prefill 阶段读取 MoE 视觉语言模型的路由信号,在模型开始生成之前识别不安全请求,且无需修改模型参数或专家路由。作者称在 Qwen3-VL 与 Kimi-VL 上测试后,该检测器大幅降低 HoliSafe benchmark 上的安全错误,并泛化到 MISHard、MM-SafetyBench 等分布外安全基准。目前尚无其他来源报道、复现结果或后续进展。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
arXiv 论文提出 router-logit 检测器,可在生成前识别 MoE 视觉语言模型的不安全请求。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv cs.CL阅读而非操纵:用 Router Logits 为 MoE 视觉语言模型做多模态安全检测
一种轻量级 router-logit 安全检测器可在 prompt prefill 阶段读取 MoE 视觉语言模型的路由信号,在生成前识别不安全请求,无需修改模型参数或专家路由。在 Qwen3-VL 与 Kimi-VL 上,它大幅降低 HoliSafe benchmark 的安全错误,并泛化到 MISHard、MM-SafetyBench 等分布外安全基准。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。