跳到正文
热点事件持续更新

NUS 提出免训练 2-bit KV cache 量化框架

1 篇报道1 个报道来源11 小时前更新

先了解这件事

AI 综述

2026 年 10 月 6 日报道,新加坡国立大学(NUS)提出免训练量化框架 QuantWM,用于视频世界模型的 KV cache 压缩,最高可实现 6.20 倍压缩。报道指出,现有 2-bit KV cache 量化方法在 VBench 上近乎无损,但直接用于视频世界模型会引发严重的时序闪烁;其原因是 Key 的扰动会改变 attention logits,从而挪动 Query 所选择的时空 token。QuantWM 即针对这一失效模式提出,以在免训练前提下完成视频世界模型的 KV cache 量化压缩。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. AGI Hunt
    QuantWM:免训练 2-bit KV cache 量化,视频世界模型压缩 6.2 倍

    新加坡国立大学提出免训练量化框架 QuantWM,视频世界模型 KV cache 最高压缩 6.20 倍。现有 2-bit KV cache 量化在 VBench 上近乎无损,但用于视频世界模型会引发严重时序闪烁,因为 Key 扰动会改变 attention logits 并挪动 Query 选中的时空 token。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。