跳到正文
原文
AGI Hunt· Spectra-Global·· 11 小时前AI 评分45

用 FFT 压缩 AdamW 优化器状态,VRAM 直接省一半

AI 导读

团队提出用 FFT 变换梯度、剔除低能量频率后压缩优化器状态,在消费级 GPU 上微调 8B/70B 模型时 VRAM 占用约降 50%,batch size 大幅提升,代价是每步多一点计算开销。避开量化是因为观察到 8-bit 量化会损害收敛。现开放内部 Colab 环境与基线权重,邀请他人验证或推翻其数学推导,并征集其他非量化省显存方案。

来源:AGI Hunt · agihunt.info