跳到正文
热点事件持续更新

SSRFT:以安全角色内化改进 LLM 安全对齐

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月7日,arXiv cs.AI 刊出研究,提出 SSRFT(Supervised Safe-Role Fine-Tuning,监督式安全角色微调),首次把 LLM 安全对齐重构为对预设安全角色的内化,而非单纯的拒绝式对齐。该方法基于心理测量学问题、少量越狱提示词和安全角色描述构建 SRQA 数据集,并在多个 Base 与 Instruct 模型上进行微调。报道称,SSRFT 相比标准 SFT 更稳健、更可泛化:对 prefilling 攻击更为稳健,对未见过的越狱领域泛化更好,同时减少了对良性查询的过度拒绝。目前该工作以预印本形式发布,尚未见后续复现或同行评审进展的报道。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.AI
    超越拒绝模式:SSRFT 以安全角色内化实现更稳健、更可泛化的 LLM 安全对齐

    研究提出 SSRFT(Supervised Safe-Role Fine-Tuning),首次把 LLM 安全对齐重构为对预设安全角色的内化,在多个 Base 与 Instruct 模型上比标准 SFT 更稳健、更可泛化。它基于心理测量学问题、少量越狱提示词和安全角色描述构建 SRQA 数据集,对 prefilling 攻击更稳健、对未见越狱领域泛化更好,并减少良性查询的过度拒绝。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。