AGI Hunt· casper_hansen_·· 3 小时前AI 评分39
SkyRL v0.4 发布:16 张 B300 即可 RL 训练万亿参数模型
AI 导读
开源 RL 后训练框架 SkyRL 发布 v0.4.0,借助 LoRA、INT4 推理服务与训练侧伪量化,仅需 16 张 B300 GPU(2 个节点)即可对 1 万亿参数的 Kimi K2.7 做全上下文强化学习训练。作者称这是目前显存效率最高的实现之一,大幅降低了超大模型 RL 后训练的硬件门槛。
来源:AGI Hunt · agihunt.info