跳到正文
热点事件持续更新

循环Transformer共享记忆省76-79%上下文内存

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

据 AGI Hunt 2026 年 10 月 7 日报道,循环 Transformer 采用共享记忆机制:只在首次递归时把内容写入 KV cache,后续递归不再重复写入、仅读取共享记忆。这一设计在 150M–1B 参数规模上并未牺牲质量,反而带来提升。报道称,在五次递归下,混合变体在 FineWeb-Edu 上的验证困惑度比标准 Transformer 低 1.12–1.82,同时上下文内存减少 76–79%。分析认为,后续递归主要关注的是共享记忆,这部分记忆充当了指向首次递归的「梯度高速公路」。目前该事件仅有这一篇报道披露细节,尚无其他来源对上述参数规模、困惑度差值或内存降幅给出独立验证。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    循环 Transformer 共享记忆反获提升:省 76-79% 上下文内存且困惑度更低

    循环 Transformer 共享记忆在 150M–1B 参数规模上质量反获提升,仅首次递归写入 KV cache、后续只读。五次递归下,混合变体在 FineWeb-Edu 上的验证困惑度比标准 Transformer 低 1.12–1.82,上下文内存减少 76–79%。后续递归主要关注共享记忆,它充当指向首次递归的「梯度高速公路」。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。