用 Gradio Workflow 重建 AUTOMATIC1111 的媒体流水线
Hugging Face 用 Gradio Workflow 把 AUTOMATIC1111(stable-diffusion-webui)的多数功能重建为一个工作流画布 Workflow1111,由 11 条媒体流水线和 73 个节点组成。
推荐理由:读者可以看到把 AUTOMATIC1111 式图像流程拆成节点图后,输出如何自动变成 REST 与 MCP 接口。
AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。
Hugging Face 用 Gradio Workflow 把 AUTOMATIC1111(stable-diffusion-webui)的多数功能重建为一个工作流画布 Workflow1111,由 11 条媒体流水线和 73 个节点组成。
推荐理由:读者可以看到把 AUTOMATIC1111 式图像流程拆成节点图后,输出如何自动变成 REST 与 MCP 接口。
Google DeepMind 面向 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解功能,将视频分析的 token 消耗降低最多 88%、成本降低最多 66%,准确率提升最多 7%。
推荐理由:原文给出 token 消耗、成本与准确率的对比数据,可用于判断长视频分析的成本结构变化。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景扩展、首尾帧插值、360p 快速草稿和最高 4K 放大等生成式视频能力,已通过 Gemini API 在 Google AI Studio 上线。
推荐理由:相较于此前只参考最后一秒,Omni 1.1 把场景扩展的前序上下文提高到 10 秒,便于评估长视频工作流的可行性。
Google DeepMind 推出图像模型 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与视频生成及对话式编辑模型 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:两款模型同步开放开发者接口并公布延迟与价格数据,便于比较图像与视频生成方案的成本取舍。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成视频,并用自然语言多轮对话编辑视频。
推荐理由:原文给出了新模型的多模态输入与对话式视频编辑能力,读者可据此判断它在现有视频生成工作流中的位置。