HeyGen 与 Google Cloud 将 Avatar IV 移植到 Trillium TPU
HeyGen 与 Google Cloud 把 18B 参数的 Avatar IV 移植到八芯片 Trillium(v6e)主机,提速 1.86×。Avatar IV 是驱动说话头视频的扩散模型栈,以 Web 和 API 提供 720p/1080p、25fps 流式渲染。迁移经 torchax 前端完成,性能接近 8×H100 生产环境,视频成本效率最高提升 25%。
HeyGen 与 Google Cloud 把 18B 参数的 Avatar IV 移植到八芯片 Trillium(v6e)主机,提速 1.86×。Avatar IV 是驱动说话头视频的扩散模型栈,以 Web 和 API 提供 720p/1080p、25fps 流式渲染。迁移经 torchax 前端完成,性能接近 8×H100 生产环境,视频成本效率最高提升 25%。
Google Research 提出 AI video co-director,一个构建在 Gemini 和 Veo 之上的统一多智能体编排框架,用于自动化生成跨镜头连贯的分钟级长视频。
AWS 在官方博客给出基于 Strands Agents SDK 的对话式视频智能方案,由大模型在运行时决定调用 Amazon Bedrock、Amazon Rekognition 还是 Amazon Transcribe,不再为每类问题预建处理流水线。
Google Beam 扩展至美国、加拿大、英国、法国、德国和日本六个国家,并由 18 家渠道合作伙伴支持部署。Google 与 Industrious 合作推出首个 Beam 扩展网络,10 月起可在美国部分 Industrious 地点预约体验。八周内部研究显示,使用 Beam 的 Google 团队连接感提升 50%、后续会议需求下降 21%。
invideo 借助 GPT‑6 Astra 规划剪辑,把色彩校正与调色效率提升至原来的 3 倍。模型让剪辑规划更精准,还使 invideo 在一天内产出 50 个自定义特效。
Higgsfield AI 借助 GPT-6 Astra,在一天内上线新的视频功能,让小型企业制作视频广告更简单。该公司也因此能更快把新的创意工具推向市场。
Hugging Face 用 Gradio Workflow 把 AUTOMATIC1111(stable-diffusion-webui)的多数功能重建为一个工作流画布 Workflow1111,由 11 条媒体流水线和 73 个节点组成。
推荐理由:读者可以看到把 AUTOMATIC1111 式图像流程拆成节点图后,输出如何自动变成 REST 与 MCP 接口。
在纪录片短片《Love, Rendered》中,Google DeepMind 与 Darren Aronofsky 的 Primordial Soup 合作,用 AI 逐帧重现 Burt 与 Ethelle Shatz 结婚 70 余年却未留下影像的相遇记忆。
Google 汇总 8 月 AI 更新,涵盖 Gemini 3.7 Flash、Gemini 3.5 Transcribe、Pixel 11 系列以及 Gemini app 月活突破 10 亿。
Google DeepMind 面向 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解功能,将视频分析的 token 消耗降低最多 88%、成本降低最多 66%,准确率提升最多 7%。
推荐理由:原文给出 token 消耗、成本与准确率的对比数据,可用于判断长视频分析的成本结构变化。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景扩展、首尾帧插值、360p 快速草稿和最高 4K 放大等生成式视频能力,已通过 Gemini API 在 Google AI Studio 上线。
推荐理由:相较于此前只参考最后一秒,Omni 1.1 把场景扩展的前序上下文提高到 10 秒,便于评估长视频工作流的可行性。
NVIDIA 发布 Cosmos-H-Dreams,一款面向手术机器人的实时、动作条件生成式模拟器,把 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型。
Google DeepMind 与 A24 宣布达成首个研究型合作,双方将建立长期研发协作,让 A24 及其电影人把 Google DeepMind 的技术创新直接嵌入创作流程,帮助艺术家开发新工作流与技术。Google 同时宣布对 A24 进行投资。该合作初期聚焦于连接前沿技术与下一代娱乐,具体目标、技术产出和创意里程碑将随时间演进。
Google DeepMind 推出图像模型 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与视频生成及对话式编辑模型 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:两款模型同步开放开发者接口并公布延迟与价格数据,便于比较图像与视频生成方案的成本取舍。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成视频,并用自然语言多轮对话编辑视频。
推荐理由:原文给出了新模型的多模态输入与对话式视频编辑能力,读者可据此判断它在现有视频生成工作流中的位置。