跳到正文
原文
AGI Hunt· techNmak·· 3 小时前AI 评分57

AirLLM 靠分层流式加载,让 70B 模型跑进 4GB 显存

AirLLM 靠分层流式加载,让 70B 模型跑进 4GB 显存

AI 导读

35K star 的开源项目 AirLLM 无需量化、蒸馏或剪枝,就能在单张 4GB GPU 上运行 70B 大模型。

来源:AGI Hunt · agihunt.info