跳到正文
热点事件持续更新

研究揭示Transformer拒答机制的稀疏结构

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月7日,arXiv cs.CL 发布一项关于 Transformer 拒答机制的研究。该研究将拒答激活引导分解为组件级干预,在四个开源权重模型中发现:拒答方向集中在仅占上游组件 28–48% 的稀疏机制上,同时仍保留 88–101% 的引导效果;在这些机制内部,约 50% 的残差流维度即可保留组件机制基线的 85–98%。研究据此认为,拒答并非弥散编码于 Transformer,而是由结构化、可识别的机制组装而成,代码与原始实验结果已公开。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.CL
    Transformer 拒答机制中的组件与维度稀疏性

    将拒答激活引导分解为组件级干预后,四个开源权重模型中的拒答方向集中在占上游组件 28–48% 的稀疏机制上,仍保留 88–101% 的引导效果。这些机制内约 50% 的残差流维度即可保留组件机制基线的 85–98%。结果表明拒答并非弥散编码于 Transformer,而是由结构化、可识别的机制组装而成,代码与原始实验结果已公开。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。