跳到正文
热点事件持续更新

研究:混合架构LLM过度依赖注意力通路

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月7日,AGI Hunt 报道了一项针对 Qwen3.5、Nemotron-H 等注意力-循环混合架构 LLM 的研究:模型几乎完全依赖注意力通路,屏蔽该通路后准确率从 30% 骤降,且经过 SFT 依然如此。研究指出两条通路各有所长——注意力擅长大海捞针类检索,循环通路则利于长上下文。为唤醒循环通路的记忆能力,研究者引入辅助训练逼出其价值,在相关任务上取得 4.6% 的提升。目前进展停留在该研究结果层面。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    研究:Qwen3.5、Nemotron-H 等混合架构 LLM 几乎只用注意力,辅助损失唤醒循环记忆

    针对 Qwen3.5、Nemotron-H 等注意力-循环混合架构 LLM 的研究发现,模型几乎完全依赖注意力通路:屏蔽注意力通路后准确率从 30% 骤降,经过 SFT 依然如此。两条通路各有所长,注意力擅长大海捞针类检索,循环通路利于长上下文。研究者通过辅助训练逼出循环记忆的价值,在相关任务上取得 4.6% 的提升。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。