热点事件持续更新
SSRFT:以安全角色内化改进 LLM 安全对齐
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月7日,arXiv cs.AI 刊出研究,提出 SSRFT(Supervised Safe-Role Fine-Tuning,监督式安全角色微调),首次把 LLM 安全对齐重构为对预设安全角色的内化,而非单纯的拒绝式对齐。该方法基于心理测量学问题、少量越狱提示词和安全角色描述构建 SRQA 数据集,并在多个 Base 与 Instruct 模型上进行微调。报道称,SSRFT 相比标准 SFT 更稳健、更可泛化:对 prefilling 攻击更为稳健,对未见过的越狱领域泛化更好,同时减少了对良性查询的过度拒绝。目前该工作以预印本形式发布,尚未见后续复现或同行评审进展的报道。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
arXiv 论文提出 SSRFT,将安全对齐重构为安全角色内化,比标准 SFT 更稳健、更可泛化。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv cs.AI超越拒绝模式:SSRFT 以安全角色内化实现更稳健、更可泛化的 LLM 安全对齐
研究提出 SSRFT(Supervised Safe-Role Fine-Tuning),首次把 LLM 安全对齐重构为对预设安全角色的内化,在多个 Base 与 Instruct 模型上比标准 SFT 更稳健、更可泛化。它基于心理测量学问题、少量越狱提示词和安全角色描述构建 SRQA 数据集,对 prefilling 攻击更稳健、对未见越狱领域泛化更好,并减少良性查询的过度拒绝。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。