arXiv cs.AI· Jinghao Pang, Jitai Hao, Qiang Huang, Zhaochun Ren, Jun Yu·· 4 小时前AI 评分36
超越拒绝模式:SSRFT 以安全角色内化实现更稳健、更可泛化的 LLM 安全对齐
Beyond Refusal Patterns: Safe-Role Internalization for Robust and Generalizable LLM Safety Alignment
AI 导读
研究提出 SSRFT(Supervised Safe-Role Fine-Tuning),首次把 LLM 安全对齐重构为对预设安全角色的内化,在多个 Base 与 Instruct 模型上比标准 SFT 更稳健、更可泛化。它基于心理测量学问题、少量越狱提示词和安全角色描述构建 SRQA 数据集,对 prefilling 攻击更稳健、对未见越狱领域泛化更好,并减少良性查询的过度拒绝。
来源:arXiv cs.AI · arxiv.org