arXiv cs.AI· Faezeh Dehghan Tarzjani, Mevan Wijewardena, Alexander Romanus, Sampad Mohanty·· 4 小时前AI 评分32
从局部证据到安全判定:SSU-Bench 对视觉语言模型的因果追踪
From Local Evidence to Safety Verdicts: Causal Tracing in Vision-Language Models
AI 导读
SSU-Bench 通过单项目提示词或图像编辑构造配对的安全与不安全图文组合,在三个视觉语言模型上迁移内部状态并测量安全判定变化。结果显示,干预变更输入位置在 decoder 更早层有效,干预最终输入 token 则到更晚层才起效。最终 token 状态的线性读出可预测模型自身判定(含错误判定),跨模型反事实变化模式相似,说明可读出的决策不等于正确的安全判断。
来源:arXiv cs.AI · arxiv.org