arXiv cs.CL· Pawe{\l} Blicharz, Mi{\l}osz Grunwald·· 2 天前AI 评分37
冻结 BERT 中 AI 文本检测神经元的机制研究:RAID 上的稀疏探针与激活修补
A Mechanistic Study of AI-Text Detection Neurons in Frozen BERT: Sparse Probing and Activation Patching on RAID
AI 导读
冻结 BERT-base-uncased 中支撑 AI 文本检测的神经元被定位:在 RAID 上对 9,216 个 CLS 隐藏维度做 L1-to-L2 稀疏探针,每个生成器不到 1% 的稳定神经元即可保留大部分全特征检测准确率。
来源:arXiv cs.CL · arxiv.org