HuggingFace Blog·· 20 天前精选AI 评分60
HF Jobs 上用 LoRA 跑异步 GRPO,500 步从 3 小时 27 分降到 53 分
Async GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL
AI 导读
TRL v1.14 的 AsyncGRPOTrainer 已支持只训练 LoRA 适配器并把它同步到 vLLM,这篇实践在此基础上把训练与推理拆到不同机器上。训练器、两个 vLLM 副本各跑一个 HF Jobs,通过挂载同一个 Storage Bucket 传递适配器而不依赖 NCCL,中间的一个代理负责按 KV 前缀路由 rollout 并向所有副本广播适配器加载。
推荐理由
这篇实践给出跨 Job 的 LoRA 异步 GRPO 配方与代理路由细节,其瓶颈定位方法可迁移到其他异步训练部署。
来源:HuggingFace Blog · huggingface.co