arXiv cs.AI· Adam Elimadi·· 5 小时前AI 评分39
GPT-2 Small 受控测试:表征简洁性与电路规模按阈值依赖方式解离
Representational Simplicity and Circuit Size Dissociate in a Threshold-Dependent Way: A Controlled Test via Adversarial Training
AI 导读
研究从同一 GPT-2 Small 检查点出发,对标准与对抗式持续训练后的模型做对照比较,发现表征更易被 SAE 分解、任务归因中启用的 SAE 特征更少的鲁棒模型,并未对应更小的忠实电路。
来源:arXiv cs.AI · arxiv.org