跳到正文
热点事件持续更新

HLA把循环语言模型的KV缓存压缩10.7倍

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月7日,arXiv cs.CL 收录一篇关于 Hybrid Latent Attention(HLA)的论文,目标是为循环语言模型(looped LM)缩减推理时的 KV cache。报道称,HLA 在 Ouro 循环语言模型上做了验证,该模型循环次数 T=4,包含 1.4B 与 2.6B 两种参数规模。结果显示,HLA 把 KV cache 缩小 10.7 倍,并使单 GPU 上可并发的序列数提升 4.0–8.8 倍。目前该事件仅有这一篇报道,尚无其他来源的复现、评测或后续更新。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.CL
    Hybrid Latent Attention(HLA):把循环语言模型的 KV cache 缩减 10.7 倍

    Hybrid Latent Attention(HLA)在 Ouro 循环语言模型(T=4,1.4B 与 2.6B 参数)上把 KV cache 缩小 10.7 倍,单 GPU 并发序列数提升 4.0-8.8 倍。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。