LDM-is-AE 论文:把 DiT 当自编码器,去掉预训练 VAE,ImageNet FID 达 1.80
LDM-is-AE 论文提出把 DiT 主干拆成互逆的 DiT-E 与 DiT-D,在所有时间步对中间特征施加图像空间监督,让 LDM 自身充当自编码器,省去单独训练的 VAE tokenizer。该方案在 ImageNet 图像生成上取得 FID 1.80,优于传统两阶段训练。论文作者包括 Zhengqiang Zhang、Lei Zhang 等(arXiv:2609.37080)。
LDM-is-AE 论文提出把 DiT 主干拆成互逆的 DiT-E 与 DiT-D,在所有时间步对中间特征施加图像空间监督,让 LDM 自身充当自编码器,省去单独训练的 VAE tokenizer。该方案在 ImageNet 图像生成上取得 FID 1.80,优于传统两阶段训练。论文作者包括 Zhengqiang Zhang、Lei Zhang 等(arXiv:2609.37080)。
NesTok 提出面向动态视觉 tokenizer 的嵌套自对齐框架,通过跨长度训练让短 token 序列接近全长序列的重建质量,在 ImageNet 上 rFID 达 0.98。其下游图像生成在 ImageNet 256×256 上取得现有可变长度自回归图像生成方法中最优 gFID 1.46。代码将公开。
MoRe-Drag 是运动锚定的拖拽式编辑方法,将像素空间 warping 作为粗运动证据注入生成采样轨迹。它通过区域感知潜在重组和阶段自适应条件,从运动结构生成转向语义精修,并以适配 MLLM 文本编码器实现无指令界面。在 DragBench-SR 和 DragBench-DR 上,其拖拽精度优于强基础编辑器并领跑 SOTA 拖拽方法,语义一致、视觉真实,代码和数据集将公开。
CrossTimeEdit 将历史街景生成重构为编辑任务,以 FLUX.2 [Klein] 4B 为起点经 SFT 与在线 RL 训练,整体性能较预训练基线提升 17.12%。其配套 VIGOR-his 数据集覆盖三大洲 11 座城市,含 43,653 个位置级四元组。模型以 Flow-GRPO 与 GDPO 优化 IA、BP、QP 三项奖励,代码、数据集与模型权重已公开。
RA-CFGCache 是面向扩散模型的 CFG 风险对齐免训练缓存框架,用引导风险组合与传播感知重缩放控制条件与无条件两个分支的缓存误差。它在 FLUX.1-dev、Wan2.1-T2V-1.3B 和 CogVideoX-2B 上改善了效率与保真度的权衡,兼容 TeaCache、DiCache、MagCache 类代理估算器,延迟几乎不变,代码已公开。
在扩散 Transformer 中加入跨视图 class-token 对齐,可在保持生成质量的同时显著提升语义表示:ImageNet 线性探测准确率提升 9.4%(class token)与 10.1%(均值池化 patch token),冻结骨干 VOC2012 分割提升 3.6 mIoU。
SAGE-Restore(Stroke-Aware Gated rEstoration)提出一种选择性满文手稿修复框架,先评估哪些区域需要修复,再据此生成修复候选并做像素级选择。
PreviewDiff 是一种无需训练的测试时搜索方法,把扩散采样从标量搜索变为对中间潜变量的多模态 critic 引导搜索。它在选定的去噪检查点解码部分预览,由多模态 judge 打分并给出自然语言反馈,据此对语义提示词编辑和局部重新加噪的潜变量分支做评分与选择性续跑。
Persistence Forcing(PerF)在像素空间扩散 Transformer 中引入异构精炼,让持续特征引导活跃特征的精炼。PerF-L 以一半参数量在 ImageNet 256×256 上取得 FID 1.91,接近 JiT-H 的 1.86;PerF-H 在 256×256 与 512×512 上分别为 1.63 和 1.76。
Meta Reality Labs 发布 Large Sparse Reconstruction Model(LSRM),获 ECCV 2026 最佳论文荣誉提名,通过扩展 transformer 上下文窗口提升前馈式 3D 重建质量。
HiRAE 分层表示自编码器通过按深度分组编码器层、在深层表示上学习残差修正,把 ImageNet-256 重建 FID 从 RAEv2 的 0.299 降至 0.209。
论文《Harness Optimization for Agentic Multi-Reference Image Generation》的官方实现 AutoRef 已在 GitHub 开源(KuOnoda/AutoRef),主题是以智能体方式优化多参考图像生成。该项目由 Reddit 用户从 arXiv 发现,适合关注图像生成与 agent 结合方向的人跟进。
NeurIPS 2026 论文 AnyBokeh 提出直接对模糊照片进行景深(bokeh)编辑,无需清晰对焦图,也无需测试时标定。该方法利用模糊中已有的光学线索推断并重调虚化效果,绕开了传统景深编辑管线必须先得到全清晰图像的前提。
Google Research 提出 Diffusion Controller 框架,把图像生成的反向去噪重构为连续控制问题,由轻量附加网络在冻结基座模型上施加引导。该框架在 Stable Diffusion v1.4 上以 SFT、RWL、PPO 三种方式评估,用 HPS-v2 衡量人类偏好对齐。其完全解锁版本对基线模型取得 90% 胜率,且无需改动闭源模型内部权重。
开发者 @LodestoneRock 通过残差数学重排,可把 DiT 等 transformer 残差模型转换成更高效的 U-Net 风格结构,中间层只处理约 1/4 的 token。推理速度比原模型快 2.3 倍,配合快速校准(calibration)能恢复大部分原始输出质量。该方法理论上适用于任意 transformer 残差模型。
Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力来自 score smoothing,而非偶然。训练中的正则化让神经网络学到的 score function 更平滑,去噪时样本落在训练数据点之间,形成插值生成。1-D 实验中 weight decay 越强 score function 越平滑,无显式正则化时的隐式正则化也有同样效果。