跳到正文
热点事件持续更新

密歇根大学改进扩散语言模型嵌入空间超越GPT-2-M

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月报道,密歇根大学提出改进连续扩散语言模型(DLM)生成性能的方法。研究团队发现,在同一模型家族内换用更强的文本嵌入,可以显著提升扩散语言模型的生成效果。但直接使用 T5Gemma-2 的原始嵌入存在问题:其区分性过强,采样时稍有偏差就会落入无效嵌入区域。为此,团队以教师模型的解码概率作为软标签进行蒸馏,训练出更连通的潜在空间。最终,该中型 DLM 在 OpenWebText 数据集上的生成困惑度(PPL)为 17.8,真实文本为 15.4,表现优于 GPT-2-M。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AGI Hunt
    密歇根大学:换用更可扩散的嵌入空间,连续扩散语言模型超越 GPT-2-M

    密歇根大学发现,连续扩散语言模型(DLM)在同家族内换用更强嵌入可显著提升生成性能,但 T5Gemma-2 原始嵌入区分性过强,采样偏差即落入无效嵌入。团队以教师解码概率作软标签做蒸馏,得到更连通的潜在空间。最终中型 DLM 在 OpenWebText 上生成 PPL 17.8(真实文本 15.4),优于 GPT-2-M。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。