Diffusion Controller 如何统一并简化 AI 图像生成
Google Research 提出 Diffusion Controller 框架,把图像生成的反向去噪重构为连续控制问题,由轻量附加网络在冻结基座模型上施加引导。该框架在 Stable Diffusion v1.4 上以 SFT、RWL、PPO 三种方式评估,用 HPS-v2 衡量人类偏好对齐。其完全解锁版本对基线模型取得 90% 胜率,且无需改动闭源模型内部权重。
Google Research 提出 Diffusion Controller 框架,把图像生成的反向去噪重构为连续控制问题,由轻量附加网络在冻结基座模型上施加引导。该框架在 Stable Diffusion v1.4 上以 SFT、RWL、PPO 三种方式评估,用 HPS-v2 衡量人类偏好对齐。其完全解锁版本对基线模型取得 90% 胜率,且无需改动闭源模型内部权重。
Google Envisioning Studio 在 Google Labs 支持下与设计师 Jane Wade、Sergio Hudson 合作,用 Google Flow 打造的两款定制工具已用于纽约时装周。
Hugging Face 用 Gradio Workflow 把 AUTOMATIC1111(stable-diffusion-webui)的多数功能重建为一个工作流画布 Workflow1111,由 11 条媒体流水线和 73 个节点组成。
推荐理由:读者可以看到把 AUTOMATIC1111 式图像流程拆成节点图后,输出如何自动变成 REST 与 MCP 接口。
在纪录片短片《Love, Rendered》中,Google DeepMind 与 Darren Aronofsky 的 Primordial Soup 合作,用 AI 逐帧重现 Burt 与 Ethelle Shatz 结婚 70 余年却未留下影像的相遇记忆。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,并更贴合用户原意。
Google 推出 Workspace 图像生成与编辑工具 Google Pics,基于 Nano Banana 模型,将在未来几周面向所有 Google AI Pro 和 Ultra 订阅者以及多数 Workspace 企业客户推送。
推荐理由:原文列出对象分割、图中文字编辑等能力与 Workspace 集成计划,可了解图像编辑如何进入现有办公流程。
Gradio 内置的 gr.Workflow 把 AI 管线变成可运行的节点图,每个节点能单独运行并就地显示中间结果,同一张图同时是 REST API 和一键部署到 Hugging Face Spaces 的入口。
推荐理由:Gradio 把多步 AI 管线做成可视化节点图,并自动生成 REST 接口与部署入口,读者可据此了解这套搭建方式。
Hugging Face 将 Nunchaku Lite 集成进 Diffusers,可用 from_pretrained() 直接加载 SVDQuant 4-bit 量化检查点,无需单独推理引擎或本地 CUDA 编译。
推荐理由:原文给出 BF16 与 4-bit 量化在显存和端到端延迟上的对比数据,可据此判断消费级显卡跑扩散模型的实际收益。
Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力来自 score smoothing,而非偶然。训练中的正则化让神经网络学到的 score function 更平滑,去噪时样本落在训练数据点之间,形成插值生成。1-D 实验中 weight decay 越强 score function 越平滑,无显式正则化时的隐式正则化也有同样效果。
PRX 系列第 4 篇披露其数据策略:预训练语料由公开与内部数据集混合构建,图像经 VLM 重新生成描述,供 7B 模型预训练使用。文本编码器从 T5Gemma 换成 Qwen3-VL 后改为训练中实时计算 text latents,吞吐损失约 3–4%,30 天训练约多 1 天。数据以 Lance 构建、MDS 流式训练,图像统一编码为 JPEG quality 92。
Google DeepMind 推出图像模型 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与视频生成及对话式编辑模型 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:两款模型同步开放开发者接口并公布延迟与价格数据,便于比较图像与视频生成方案的成本取舍。
Google 将一套 3D 感知的照片重构图方法上线到 Google Photos 的 Auto frame 功能,可自动调整相机视角并补全原本未拍到的画面。该方法先用内部 3D 点图估计模型获取每个像素的 3D 点并估算原相机焦距,再用生成式潜空间扩散模型填补新视角渲染后出现的空缺。
推荐理由:相较裁剪和缩放,这套方法把照片还原成 3D 场景并重设相机视角,可了解生成式修图的一种实现路径。
Mistral 为 Le Chat 推出一批新功能,包括 Deep Research(预览)、语音模式、原生多语言推理、Projects 和图像编辑。Deep Research 由工具增强的研究 agent 驱动,可产出带引用的结构化报告;语音模式基于新语音模型 Voxtral,推理能力来自 Magistral 模型。