arXiv cs.CL· Muhammad Usama, Dong Eui Chang·· 8 小时前AI 评分56
论文《系统提示错觉》:指令前导如何改变语言模型内部计算
The System Prompt Illusion: How Instruction Preambles Modify Computation in Language Models
AI 导读
论文用 CKA 比较 17 个指令微调模型在 20 条系统提示下的逐层表征,发现系统提示对内部计算的影响具有层选择性且随指令类型而异。人格与格式类指令深度重构中间层表征,安全类指令几乎不改变表征,其变化与最小基线在统计上无法区分。
来源:arXiv cs.CL · arxiv.org