跳到正文
原文
AGI Hunt· ChengleiSi·· 4 小时前AI 评分34

循环语言模型新法:参数与 KV cache 省 3 倍仍媲美 Transformer

循环语言模型新法:参数与 KV 缓存省 3 倍仍媲美 Transformer

AI 导读

huskydogewoof 发布「Rethinking at Fixed Points」,主张循环语言模型(looped LMs)可用 3 倍更少的参数和 3 倍更小的 KV cache,达到与标准 Transformer 相当的效果,即以恒定内存增加 FLOPs 来扩展能力。

来源:AGI Hunt · agihunt.info