ComfyUI v0.38.0 发布:新增 Ming Image、H3 ControlNet Union 2.0 与 ID-V2V 支持
ComfyUI v0.38.0 发布,新增 Ming Image 0.1 6B 文生图模型、MiniMax-H3 Fun ControlNet Union 2.0 与基于 Wan 2.1 和 VACE 的 ID-V2V 身份保持视频转视频支持。
推荐理由:版本清单列出新增模型节点与量化、HDR 支持,可据此判断现有 ComfyUI 工作流是否要调整。
AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。
ComfyUI v0.38.0 发布,新增 Ming Image 0.1 6B 文生图模型、MiniMax-H3 Fun ControlNet Union 2.0 与基于 Wan 2.1 和 VACE 的 ID-V2V 身份保持视频转视频支持。
推荐理由:版本清单列出新增模型节点与量化、HDR 支持,可据此判断现有 ComfyUI 工作流是否要调整。
网友分享了一个 ChatGPT Image 的玩法:从地图网站下载任意城市的街道地图并上传,用提示词让模型转成半 3D 风格的趣味地图,突出标志性建筑和有趣地点。提示词还要求生成一条串联所有景点的步行路线,并附上带地名的图例,替换城市名即可直接复制使用,适合做旅行规划或城市导览素材。
推荐理由:提示词可替换城市名直接复用,为旅行导览或城市地图素材提供了一种低成本的生成方式。
Hugging Face 用 Gradio Workflow 把 AUTOMATIC1111(stable-diffusion-webui)的多数功能重建为一个工作流画布 Workflow1111,由 11 条媒体流水线和 73 个节点组成。
推荐理由:读者可以看到把 AUTOMATIC1111 式图像流程拆成节点图后,输出如何自动变成 REST 与 MCP 接口。
Google 推出 Workspace 图像生成与编辑工具 Google Pics,基于 Nano Banana 模型,将在未来几周面向所有 Google AI Pro 和 Ultra 订阅者以及多数 Workspace 企业客户推送。
推荐理由:原文列出对象分割、图中文字编辑等能力与 Workspace 集成计划,可了解图像编辑如何进入现有办公流程。
Gradio 内置的 gr.Workflow 把 AI 管线变成可运行的节点图,每个节点能单独运行并就地显示中间结果,同一张图同时是 REST API 和一键部署到 Hugging Face Spaces 的入口。
推荐理由:Gradio 把多步 AI 管线做成可视化节点图,并自动生成 REST 接口与部署入口,读者可据此了解这套搭建方式。
Hugging Face 将 Nunchaku Lite 集成进 Diffusers,可用 from_pretrained() 直接加载 SVDQuant 4-bit 量化检查点,无需单独推理引擎或本地 CUDA 编译。
推荐理由:原文给出 BF16 与 4-bit 量化在显存和端到端延迟上的对比数据,可据此判断消费级显卡跑扩散模型的实际收益。
Google DeepMind 推出图像模型 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与视频生成及对话式编辑模型 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:两款模型同步开放开发者接口并公布延迟与价格数据,便于比较图像与视频生成方案的成本取舍。
Google 将一套 3D 感知的照片重构图方法上线到 Google Photos 的 Auto frame 功能,可自动调整相机视角并补全原本未拍到的画面。该方法先用内部 3D 点图估计模型获取每个像素的 3D 点并估算原相机焦距,再用生成式潜空间扩散模型填补新视角渲染后出现的空缺。
推荐理由:相较裁剪和缩放,这套方法把照片还原成 3D 场景并重设相机视角,可了解生成式修图的一种实现路径。