跳到正文

#图像生成

今日 21 条
今天9月30日周三
  1. AGI Hunt42

    LDM-is-AE 论文:把 DiT 当自编码器,去掉预训练 VAE,ImageNet FID 达 1.80

    LDM-is-AE 论文提出把 DiT 主干拆成互逆的 DiT-E 与 DiT-D,在所有时间步对中间特征施加图像空间监督,让 LDM 自身充当自编码器,省去单独训练的 VAE tokenizer。该方案在 ImageNet 图像生成上取得 FID 1.80,优于传统两阶段训练。论文作者包括 Zhengqiang Zhang、Lei Zhang 等(arXiv:2609.37080)。

  2. arXiv cs.CV36

    MoRe-Drag:以拖拽为证据的运动锚定潜在重组,用于拖拽式编辑

    MoRe-Drag 是运动锚定的拖拽式编辑方法,将像素空间 warping 作为粗运动证据注入生成采样轨迹。它通过区域感知潜在重组和阶段自适应条件,从运动结构生成转向语义精修,并以适配 MLLM 文本编码器实现无指令界面。在 DragBench-SR 和 DragBench-DR 上,其拖拽精度优于强基础编辑器并领跑 SOTA 拖拽方法,语义一致、视觉真实,代码和数据集将公开。

  3. arXiv cs.CV35

    CrossTimeEdit:面向历史街景生成的十年跨度跨视角数据集与奖励引导编辑

    CrossTimeEdit 将历史街景生成重构为编辑任务,以 FLUX.2 [Klein] 4B 为起点经 SFT 与在线 RL 训练,整体性能较预训练基线提升 17.12%。其配套 VIGOR-his 数据集覆盖三大洲 11 座城市,含 43,653 个位置级四元组。模型以 Flow-GRPO 与 GDPO 优化 IA、BP、QP 三项奖励,代码、数据集与模型权重已公开。

  4. arXiv cs.CV40

    RA-CFGCache:从分支级判据到 Classifier-Free Guidance 下的引导风险控制

    RA-CFGCache 是面向扩散模型的 CFG 风险对齐免训练缓存框架,用引导风险组合与传播感知重缩放控制条件与无条件两个分支的缓存误差。它在 FLUX.1-dev、Wan2.1-T2V-1.3B 和 CogVideoX-2B 上改善了效率与保真度的权衡,兼容 TeaCache、DiCache、MagCache 类代理估算器,延迟几乎不变,代码已公开。

  5. AGI Hunt52

    去掉阴影背景后角色 LoRA 学会悬浮:数据集踩坑实录

    一位 Reddit 用户分享角色 LoRA 训练踩坑:此前积累的上百万张孤立角色图被证明不适合训练,正确做法是每套只用少量图,并为角色配上不同场景背景。他基于一手经验判断 AI 分不清 Photoshop 合成的阴影,索性全部不加阴影,结果模型把悬浮当成了角色特征,学到「这个人会悬浮、经常离地面 0.5-3 英寸」。

  6. Google Research45

    Diffusion Controller 如何统一并简化 AI 图像生成

    Google Research 提出 Diffusion Controller 框架,把图像生成的反向去噪重构为连续控制问题,由轻量附加网络在冻结基座模型上施加引导。该框架在 Stable Diffusion v1.4 上以 SFT、RWL、PPO 三种方式评估,用 HPS-v2 衡量人类偏好对齐。其完全解锁版本对基线模型取得 90% 胜率,且无需改动闭源模型内部权重。

9月29日周二
  1. AGI Hunt68

    实用提示词:用 ChatGPT Image 把城市街道地图转成半 3D 导览图

    网友分享了一个 ChatGPT Image 的玩法:从地图网站下载任意城市的街道地图并上传,用提示词让模型转成半 3D 风格的趣味地图,突出标志性建筑和有趣地点。提示词还要求生成一条串联所有景点的步行路线,并附上带地名的图例,替换城市名即可直接复制使用,适合做旅行规划或城市导览素材。

    推荐理由:提示词可替换城市名直接复用,为旅行导览或城市地图素材提供了一种低成本的生成方式。

  2. AGI Hunt41

    别再要「电影感」:一套 Midjourney 油画惊悚片导演系统提示词

    针对 Midjourney V8.2 的一套系统提示词将其设定为「油画动画惊悚片导演」,让提示词像导演一样执导整部影片,而非堆砌「cinematic」等词。它用于生成油画质感的动画电影剧照,涵盖人像、对话、动作、环境与连贯叙事,默认都市悬疑,用色块和可见笔触构建体积感,拒绝光滑塑料感与扁平矢量风。支持有无参考图/moodboard 两种工作方式。

  3. AGI Hunt43

    开发者 vibe-code 出 ComfyUI-BubbleText 节点,自动修复漫画气泡框里的乱码文字

    Reddit 用户 arturor1990 发布开源节点包 ComfyUI-BubbleText,可自动擦除 AI 生成图片对话气泡内的乱码字母并写入用户指定的真实文本。该节点支持 emoji,兼容 Anima、Illustrious 和 NoobAI 模型,可配合 LoRA Manager 使用。作者坦承项目是 vibe-coded,节点标签为西班牙语,已在 GitHub 开源并征集反馈。