跳到正文
原文
arXiv cs.CL· Yuhan Chen, Siyuan Zhang, Nan Wang, Feiyang Kang, Ruoxi Jia·· 4 小时前AI 评分46

Hybrid Latent Attention(HLA):把循环语言模型的 KV cache 缩减 10.7 倍

Hybrid Latent Attention for Looped Language Models

AI 导读

Hybrid Latent Attention(HLA)在 Ouro 循环语言模型(T=4,1.4B 与 2.6B 参数)上把 KV cache 缩小 10.7 倍,单 GPU 并发序列数提升 4.0-8.8 倍。

来源:arXiv cs.CL · arxiv.org