跳到正文
原文
Apple Machine Learning Research·· 14 天前AI 评分42

DACA-GRPO:面向扩散语言模型强化学习的去噪感知信用分配

DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models

AI 导读

DACA-GRPO 为扩散语言模型强化学习引入去噪感知信用分配,可作为任意 GRPO 训练器的轻量即插即用增强。在三种 GRPO 基线方法上,它在涵盖数学推理、代码生成、约束满足与 JSON schema 遵循等七个 benchmark 上取得一致提升,最高增益分别为 5.6pp、7.4pp、36.3pp 和 5.9pp。

来源:Apple Machine Learning Research · machinelearning.apple.com