热点事件持续更新
位置感知调制缓解统一多模态模型梯度冲突
1 篇报道1 个报道来源7 小时前更新
先了解这件事
AI 综述
统一多模态模型同时承担理解与生成,两类任务的梯度冲突是长期难题。2026年10月1日,arXiv cs.CV 一项研究提出位置级干扰图与位置感知调制(PAM),把理解与生成的梯度冲突进一步归因到每层内部的视觉 token 位置,而非仅停留在层级。该干扰图只需单次反向传播即可算出,计算成本为标准反向传播的 1.2 倍。研究在 Show-o 与 Janus-Pro 上给出位置层面的解释,冲突方差分别达到 partial η²=0.31 与 0.15,显示冲突在不同视觉 token 位置上的分布并不均匀,为按位置调制以缓解冲突提供了依据。
AI 根据报道生成 · 1 小时前更新
最新进展10月1日 12:00
研究提出 PAM,将梯度冲突归因到层内视觉 token 位置,成本仅标准反向传播 1.2 倍。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- arXiv cs.CV超越层级:统一多模态模型中的位置级梯度冲突与位置感知调制 PAM
研究提出位置级干扰图与位置感知调制(PAM),把统一多模态模型理解与生成的梯度冲突归因到每层内的视觉 token 位置。该图由单次反向传播算出,成本为标准反向传播的 1.2×,在 Show-o 与 Janus-Pro 上位置解释冲突方差达 partial η²=0.31 和 0.15。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。