跳到正文
原文
arXiv cs.CL· Parisa Salmani, Peter R. Lewis·· 8 小时前AI 评分39

评估大语言模型在长对抗对话中的安全性

Evaluating Language Model Safety Across Long Adversarial Conversations

AI 导读

研究让第二个语言模型扮演持续对抗用户,测试三个开源权重指令微调模型在两组长有害提示、不同对话长度和随机种子下的安全性:首轮安全回复率为 85%–100%,到第 11 轮降至 38%–61%,第 101 轮降至 15%–44%。

来源:arXiv cs.CL · arxiv.org