跳到正文
原文
arXiv cs.CL· Kaibo Wang, Ding Ding, Fangyu Ding, Zijin Feng, Han Shi, Haili Bai, Jiacheng Sun, Yang Xiang·· 4 小时前AI 评分39

LUDI:更少均匀性的离散扩散语言模型更强大、更可扩展

Less Uniform Discrete Diffusion is More Powerful and Scalable

AI 导读

LUDI 用更少均匀性的损失与 per-token 时间嵌入,让每个反向转移指向干净 token,实现基于置信度的少步采样。监督更干净、少步生成更好;7B 自回归模型继续训练为 LUDI-7B 后具备复杂推理能力,相比 AR 解码有每步 3 token 加速,性能与 masked diffusion 基线相当。

来源:arXiv cs.CL · arxiv.org