AGI Hunt· Gauri_the_great·· 2 小时前AI 评分46
苹果 KV-Lingo 论文:跨模型切换 LLM 提速最高 29 倍
苹果 KV-Lingo 论文:跨模型切换 LLM 提速最高 29 倍
AI 导读
苹果论文 KV-Lingo 训练一个线性翻译器,把源模型的 KV cache 直接映射到目标模型的表示空间,跨模型切换 LLM 时免去重新 prefill。在 H100 上,同构 Qwen3 模型对在 2k token 前缀下切换比重新 prefill 快 4.8–5.6 倍,32k token 下快 12–29 倍,后续解码保持原生速度。
来源:AGI Hunt · agihunt.info