跳到正文
热点事件持续更新

腾讯混元开源 Prism 动态稀疏注意力框架

3 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

2026 年 10 月 6 日,腾讯混元开源了名为 Prism 的动态稀疏注意力框架,面向原生 2K 分辨率视频-音频联合生成模型的训练。当日报道称,该框架旨在解决全注意力在 2K 分辨率下二次方开销过高的问题:它把 token 序列组织成时空宏区,依据视频通道方差与音频到视频交叉注意力范数,评估各区域的信息结构与音视频耦合强度,从而动态分配定制块形状,并用混合块选择策略按查询决定稀疏度;相比全注意力训练,可让 2K 视频-音频联合训练提速约 2.5 倍,且生成质量更好,代码已放出。当日 11:17 与 11:59 两篇报道对提速幅度、适用场景与代码开源的表述一致。12:33 的后续报道补充称,该工作是腾讯混元联合复旦、浙大开源,模型已在 Hugging Face 上线并采用 MIT 许可,方法上还用于缓解高分辨率下注意力被冗余 token 稀释的问题。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. AGI Hunt
    腾讯混元开源 Prism:动态稀疏注意力实现原生 2K 视频+音频联合生成

    腾讯混元联合复旦、浙大开源视频生成模型 Prism,已在 Hugging Face 上线,采用 MIT 许可,主打原生 2K 分辨率的视频与音频联合生成训练。方法上用动态稀疏注意力替代全注意力,把 token 序列组织成时空宏区,并依据视频特征通道方差与音频到视频交叉注意力的特征范数动态分配注意力块形状,以缓解高分辨率下注意力被冗余 token 稀释的问题。

  2. AGI Hunt
    腾讯混元开源 Prism,助力 2K 视频音频联合生成

    腾讯混元团队开源 Prism 框架,以动态稀疏注意力解决全注意力在 2K 分辨率下二次方开销过高的问题,面向原生 2K 视频-音频联合生成模型的训练。该方案可将 2K 视频-音频联合训练提速约 2.5 倍,代码已放出,为高分辨率多模态生成提供更高效的训练路径。

  3. AGI Hunt
    腾讯混元开源 Prism:动态稀疏注意力让 2K 视频-音频联合训练提速 2.5 倍

    腾讯混元开源 Prism 动态稀疏注意力框架,面向原生 2K 分辨率视频-音频联合生成模型训练,相比全注意力训练提速 2.5 倍且生成质量更好。该框架把 token 序列组织成时空宏区,依据视频通道方差与音频到视频交叉注意力范数评估各区域信息结构和音视频耦合强度,动态分配定制块形状,并用混合块选择策略按查询决定稀疏度。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。