跳到正文
原文
AGI Hunt· umich·· 3 小时前AI 评分38

密歇根大学:换用更可扩散的嵌入空间,连续扩散语言模型超越 GPT-2-M

密歇根大学:换更可扩散的嵌入空间,连续扩散语言模型超越 GPT-2-M

AI 导读

密歇根大学发现,连续扩散语言模型(DLM)在同家族内换用更强嵌入可显著提升生成性能,但 T5Gemma-2 原始嵌入区分性过强,采样偏差即落入无效嵌入。团队以教师解码概率作软标签做蒸馏,得到更连通的潜在空间。最终中型 DLM 在 OpenWebText 上生成 PPL 17.8(真实文本 15.4),优于 GPT-2-M。

来源:AGI Hunt · agihunt.info