热点事件持续更新
HLA把循环语言模型的KV缓存压缩10.7倍
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月7日,arXiv cs.CL 收录一篇关于 Hybrid Latent Attention(HLA)的论文,目标是为循环语言模型(looped LM)缩减推理时的 KV cache。报道称,HLA 在 Ouro 循环语言模型上做了验证,该模型循环次数 T=4,包含 1.4B 与 2.6B 两种参数规模。结果显示,HLA 把 KV cache 缩小 10.7 倍,并使单 GPU 上可并发的序列数提升 4.0–8.8 倍。目前该事件仅有这一篇报道,尚无其他来源的复现、评测或后续更新。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv cs.CLHybrid Latent Attention(HLA):把循环语言模型的 KV cache 缩减 10.7 倍
Hybrid Latent Attention(HLA)在 Ouro 循环语言模型(T=4,1.4B 与 2.6B 参数)上把 KV cache 缩小 10.7 倍,单 GPU 并发序列数提升 4.0-8.8 倍。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。