arXiv cs.AI· Benoit Dherin, Michael Munn, Xavier Gonzalvo, Adrian Goldwaser, Blaz Bratanic, Ananth Balashankar, Andrey Vlasov, Pinzhi Huang, Cecile Loge, Nicole Mitchell, Andre Fernandes, Trilok Acharya, Wendy Kan, Ziyue Wang, Hanna Mazzawi, Felipe Tiengo Ferreira, Mor Geva·· 5 小时前AI 评分44
安全算子:通过谱优化调节安全指令的表达
The Safety Operator: Modulating the Expression of Safety Instructions via Spectral Optimization
AI 导读
研究者把 Transformer 语言模型中上下文 token 吸收进权重形成的乘法算子称为“安全算子”,其主导特征值可像连续旋钮一样调节安全指令对生成的影响强度。
来源:arXiv cs.AI · arxiv.org