跳到正文
原文
arXiv cs.CL· Muhammad Usama, Dong Eui Chang·· 8 小时前AI 评分56

论文《系统提示错觉》:指令前导如何改变语言模型内部计算

The System Prompt Illusion: How Instruction Preambles Modify Computation in Language Models

AI 导读

论文用 CKA 比较 17 个指令微调模型在 20 条系统提示下的逐层表征,发现系统提示对内部计算的影响具有层选择性且随指令类型而异。人格与格式类指令深度重构中间层表征,安全类指令几乎不改变表征,其变化与最小基线在统计上无法区分。

来源:arXiv cs.CL · arxiv.org