LDM-is-AE 论文:把 DiT 当自编码器,去掉预训练 VAE,ImageNet FID 达 1.80
LDM-is-AE 论文提出把 DiT 主干拆成互逆的 DiT-E 与 DiT-D,在所有时间步对中间特征施加图像空间监督,让 LDM 自身充当自编码器,省去单独训练的 VAE tokenizer。该方案在 ImageNet 图像生成上取得 FID 1.80,优于传统两阶段训练。论文作者包括 Zhengqiang Zhang、Lei Zhang 等(arXiv:2609.37080)。
LDM-is-AE 论文提出把 DiT 主干拆成互逆的 DiT-E 与 DiT-D,在所有时间步对中间特征施加图像空间监督,让 LDM 自身充当自编码器,省去单独训练的 VAE tokenizer。该方案在 ImageNet 图像生成上取得 FID 1.80,优于传统两阶段训练。论文作者包括 Zhengqiang Zhang、Lei Zhang 等(arXiv:2609.37080)。
ComfyUI v0.38.0 发布,新增 Ming Image 0.1 6B 文生图模型、MiniMax-H3 Fun ControlNet Union 2.0 与基于 Wan 2.1 和 VACE 的 ID-V2V 身份保持视频转视频支持。
推荐理由:版本清单列出新增模型节点与量化、HDR 支持,可据此判断现有 ComfyUI 工作流是否要调整。
OpenAI Bot 支持自定义宠物:用户只需生成一张想要的形象图并交给 Bot,它就会创建一个带姿势和动作的动画宠物,并加入你的宠物收藏。作者 alexcovo_eth 展示了自制的 Bot「TOAA」作为实例,后续帖子补充了等待动画生成、上线使用的完整流程。
开发者 BlendiByl 开源了免费框架 Dioramas,用于搭建电影感、可交互的 3D 网站,无付费层也无需注册。其 AI 资产管线先用 Nano Banana 2(fal)生成白底产品图,再由 Meshy 7.1 以 image-to-3D 生成 6 万至 25 万面数的 PBR 模型,所有 3D 物体均为生成而非建模。
NesTok 提出面向动态视觉 tokenizer 的嵌套自对齐框架,通过跨长度训练让短 token 序列接近全长序列的重建质量,在 ImageNet 上 rFID 达 0.98。其下游图像生成在 ImageNet 256×256 上取得现有可变长度自回归图像生成方法中最优 gFID 1.46。代码将公开。
MoRe-Drag 是运动锚定的拖拽式编辑方法,将像素空间 warping 作为粗运动证据注入生成采样轨迹。它通过区域感知潜在重组和阶段自适应条件,从运动结构生成转向语义精修,并以适配 MLLM 文本编码器实现无指令界面。在 DragBench-SR 和 DragBench-DR 上,其拖拽精度优于强基础编辑器并领跑 SOTA 拖拽方法,语义一致、视觉真实,代码和数据集将公开。
CrossTimeEdit 将历史街景生成重构为编辑任务,以 FLUX.2 [Klein] 4B 为起点经 SFT 与在线 RL 训练,整体性能较预训练基线提升 17.12%。其配套 VIGOR-his 数据集覆盖三大洲 11 座城市,含 43,653 个位置级四元组。模型以 Flow-GRPO 与 GDPO 优化 IA、BP、QP 三项奖励,代码、数据集与模型权重已公开。
RA-CFGCache 是面向扩散模型的 CFG 风险对齐免训练缓存框架,用引导风险组合与传播感知重缩放控制条件与无条件两个分支的缓存误差。它在 FLUX.1-dev、Wan2.1-T2V-1.3B 和 CogVideoX-2B 上改善了效率与保真度的权衡,兼容 TeaCache、DiCache、MagCache 类代理估算器,延迟几乎不变,代码已公开。
在扩散 Transformer 中加入跨视图 class-token 对齐,可在保持生成质量的同时显著提升语义表示:ImageNet 线性探测准确率提升 9.4%(class token)与 10.1%(均值池化 patch token),冻结骨干 VOC2012 分割提升 3.6 mIoU。
SAGE-Restore(Stroke-Aware Gated rEstoration)提出一种选择性满文手稿修复框架,先评估哪些区域需要修复,再据此生成修复候选并做像素级选择。
PreviewDiff 是一种无需训练的测试时搜索方法,把扩散采样从标量搜索变为对中间潜变量的多模态 critic 引导搜索。它在选定的去噪检查点解码部分预览,由多模态 judge 打分并给出自然语言反馈,据此对语义提示词编辑和局部重新加噪的潜变量分支做评分与选择性续跑。
Persistence Forcing(PerF)在像素空间扩散 Transformer 中引入异构精炼,让持续特征引导活跃特征的精炼。PerF-L 以一半参数量在 ImageNet 256×256 上取得 FID 1.91,接近 JiT-H 的 1.86;PerF-H 在 256×256 与 512×512 上分别为 1.63 和 1.76。
Meta Reality Labs 发布 Large Sparse Reconstruction Model(LSRM),获 ECCV 2026 最佳论文荣誉提名,通过扩展 transformer 上下文窗口提升前馈式 3D 重建质量。
HiRAE 分层表示自编码器通过按深度分组编码器层、在深层表示上学习残差修正,把 ImageNet-256 重建 FID 从 RAEv2 的 0.299 降至 0.209。
视频博主 EHuanglu 用 Claude Opus 5.5 生成了一段想象《戴珍珠耳环的少女》被创作那一刻的视频,画面被认为真实而动人,获得包括 justin_hart 在内的多人转发称赞。
downey.ai 在 Instagram 发布的 AI 生成名人图像「Flying cars they said… part 2」,把音乐人变成了离谱的 AI「摇滚巨星」形象,被 Reddit 用户转发后引发吐槽。帖子还提到这类 AI 生成名人图已泛滥,连 Bruno Mars 版本都出现过,并讨论这些名人是否真的会看到类似内容。
论文《Harness Optimization for Agentic Multi-Reference Image Generation》的官方实现 AutoRef 已在 GitHub 开源(KuOnoda/AutoRef),主题是以智能体方式优化多参考图像生成。该项目由 Reddit 用户从 arXiv 发现,适合关注图像生成与 agent 结合方向的人跟进。
一位 Reddit 用户分享角色 LoRA 训练踩坑:此前积累的上百万张孤立角色图被证明不适合训练,正确做法是每套只用少量图,并为角色配上不同场景背景。他基于一手经验判断 AI 分不清 Photoshop 合成的阴影,索性全部不加阴影,结果模型把悬浮当成了角色特征,学到「这个人会悬浮、经常离地面 0.5-3 英寸」。
NeurIPS 2026 论文 AnyBokeh 提出直接对模糊照片进行景深(bokeh)编辑,无需清晰对焦图,也无需测试时标定。该方法利用模糊中已有的光学线索推断并重调虚化效果,绕开了传统景深编辑管线必须先得到全清晰图像的前提。
一位图像创作者实测后认为,T2I 任务上 Krea 2 比 Qwen 2.1 更胜一筹。同样提示词增强下,Qwen 2.1 出图偏真实照片质感、纹理发灰,默认人物偏亚洲/动漫风,需加「West cartoon semi-realistic style」纠正。他偏好半写实卡通风格,此前用 Krea 2 Turbo 工作流几乎次次命中。
Google Research 提出 Diffusion Controller 框架,把图像生成的反向去噪重构为连续控制问题,由轻量附加网络在冻结基座模型上施加引导。该框架在 Stable Diffusion v1.4 上以 SFT、RWL、PPO 三种方式评估,用 HPS-v2 衡量人类偏好对齐。其完全解锁版本对基线模型取得 90% 胜率,且无需改动闭源模型内部权重。
字节 Seedream 5.0 Flash 已在 Runware 平台上线,主打高吞吐量图片编辑,价格为每张输出图片 $0.019 起。该模型最多可用 10 张参考图进行编辑,能将一张图分解为最多 16 层 PNG 图层,并支持通过精确的 prompt 坐标定位做局部编辑。
创作者 tischeins 启动「Single-Word-Prompt」实验,第一期只用单词 Mellifluous 搭配 --ar 5:4 --v 8.2 参数在 Midjourney 出图。该实验展示极简提示词下模型对抽象词汇的视觉诠释能力,适合研究提示词极简与模型理解边界的玩法。
作者 michaelrabone 分享了 Midjourney 8.2 写实人像提示词的核心配方,关键是用自然不完美的皮肤质感替代理想化皮肤。配方强调毛孔、雀斑、细纹和绒毛等细节,搭配自然户外光、Canon DSLR、85mm f/1.4 镜头等描述,技术参数为 --raw --s 200 --v 8.2,可用 --no glasses 做排除控制。
新加坡起诉一名男子,其据称用 AI 生成了一张鳄鱼图片,引发公众恐慌,迫使当局关闭一座大型水库的活动长达两天。该消息被描述为 AI 生成虚假内容引发现实安全响应的一个案例。
博主 tischeins 在 X 上分享了一个 Midjourney 风格参考码 --sref 3353480254,并配上示例生成图,标注 #midjourney #sref #aiart,供其他创作者直接复用该风格。
azed_ai 分享了一个名为 Fluid Ink Gesture 的图像生成提示词模板,用富有表现力的流动黑色笔触、简化优雅的剪影、粗细变化的线条和大量留白,在纯白背景上生成极简泼墨风格画作。模板中 [subject] 可替换为主体,[dynamic action] 可替换为动态动作,强调负空间与大写意构图。
博主 michaelrabone 公开自调的 Midjourney 风格参考码 --sref 3896456162,主打 1970 年代柯达胶片搭配迪斯科的复古质感,可适用于 Seedance 等工具。他把同一风格码用在章鱼、UFO 等不同题材上实测,展示该参数组合的泛化表现。
开发者 @LodestoneRock 通过残差数学重排,可把 DiT 等 transformer 残差模型转换成更高效的 U-Net 风格结构,中间层只处理约 1/4 的 token。推理速度比原模型快 2.3 倍,配合快速校准(calibration)能恢复大部分原始输出质量。该方法理论上适用于任意 transformer 残差模型。
Reddit 用户分享实测:在 Qwen 图像模型上叠加自制 LoRA 后,出图不再偏暗和"脏",效果明显改善。该 LoRA 已发布在 Civitai("Qwen image 21 beautiful"),可直接下载使用。
一位 ComfyUI Cloud 新手在 Reddit 求助:用 Qwen Image Edit 2511 把 Pinterest 真人照片的姿态、构图与光线迁移到自己的照片并叠加环境、服装参考图时,出现身份漂移、比例改变和皮肤过度磨皮。
网友分享了一个 ChatGPT Image 的玩法:从地图网站下载任意城市的街道地图并上传,用提示词让模型转成半 3D 风格的趣味地图,突出标志性建筑和有趣地点。提示词还要求生成一条串联所有景点的步行路线,并附上带地名的图例,替换城市名即可直接复制使用,适合做旅行规划或城市导览素材。
推荐理由:提示词可替换城市名直接复用,为旅行导览或城市地图素材提供了一种低成本的生成方式。
一位有总监与美术总监经验的独立开发者公开了约 8 个月用 Claude 开发 Unity 动作 Roguelite《Steel Maiden》的 AI 工作流,该游戏已在 Steam 提供免费 Demo。
用户 Intelligent-Lynx-953 在 reddit 发布一张 AI 生成的梗图,把电影《华尔街之狼》的场景重制成 2026 年版本,吐槽当下的 AI 行业文化,大概率和炒作、暴富叙事相关。图见原帖,是一张轻松一笑的圈内梗。
摄影师 tischeins 分享了一组 Midjourney v8.2 黑白人像提示词,描写年轻女性清晨在床上伸展的场景,参数为 --v 8.2 --ar 5:4。
Reddit 用户 SmoothSalary7439 分享了一组名为「Krea2」的生成作品图集,并表达了对该模型创作效果的喜爱。帖子正文信息极少,实质内容集中在配图中,需点开原帖查看具体生成效果。
针对 Midjourney V8.2 的一套系统提示词将其设定为「油画动画惊悚片导演」,让提示词像导演一样执导整部影片,而非堆砌「cinematic」等词。它用于生成油画质感的动画电影剧照,涵盖人像、对话、动作、环境与连贯叙事,默认都市悬疑,用色块和可见笔触构建体积感,拒绝光滑塑料感与扁平矢量风。支持有无参考图/moodboard 两种工作方式。
博主 XFreeze 调侃,当前 AI 最难的问题不是推理或对齐,而是设计一个看起来不像臀缝的 logo。其引用的 AI 生成 logo 被网友吐槽「像几个屁股眼」。这反映出 AI 图形/logo 生成在抽象对称图形上常见的翻车现象。
Reddit 用户 arturor1990 发布开源节点包 ComfyUI-BubbleText,可自动擦除 AI 生成图片对话气泡内的乱码字母并写入用户指定的真实文本。该节点支持 emoji,兼容 Anima、Illustrious 和 NoobAI 模型,可配合 LoRA Manager 使用。作者坦承项目是 vibe-coded,节点标签为西班牙语,已在 GitHub 开源并征集反馈。
博主 DAKKADAKKA1 自曝被 AI 生成的人物形象骗到,以为照片里「穿大衣的金发男子」是真人;bennash 转发感叹自己也一直以为此人真实存在。这成为 AI 生成内容以假乱真、连从业者都中招的又一个名场面。