AGI Hunt· techNmak·2026-10-03 16:46· 3 小时前AI 评分57AirLLM 靠分层流式加载,让 70B 模型跑进 4GB 显存AirLLM 靠分层流式加载,让 70B 模型跑进 4GB 显存AI 导读35K star 的开源项目 AirLLM 无需量化、蒸馏或剪枝,就能在单张 4GB GPU 上运行 70B 大模型。来源:AGI Hunt · agihunt.info#开源/仓库#部署/工程#推理查看事件全部后续