Diffusion Controller 如何统一并简化 AI 图像生成
Google Research 提出 Diffusion Controller 框架,把图像生成的反向去噪重构为连续控制问题,由轻量附加网络在冻结基座模型上施加引导。该框架在 Stable Diffusion v1.4 上以 SFT、RWL、PPO 三种方式评估,用 HPS-v2 衡量人类偏好对齐。其完全解锁版本对基线模型取得 90% 胜率,且无需改动闭源模型内部权重。
Google Research 提出 Diffusion Controller 框架,把图像生成的反向去噪重构为连续控制问题,由轻量附加网络在冻结基座模型上施加引导。该框架在 Stable Diffusion v1.4 上以 SFT、RWL、PPO 三种方式评估,用 HPS-v2 衡量人类偏好对齐。其完全解锁版本对基线模型取得 90% 胜率,且无需改动闭源模型内部权重。
Google 在开发者博客给出在树莓派 5 上用 LiteRT 与 Gemma 运行端侧 AI 的部署指南。据文中数据,Gemma 4 E2B 在 LiteRT-LM 下达到 99 tokens/sec prefill 与 9 tokens/sec decode,峰值内存 1432 MB。
Google Developers Blog 发文论述 Go 为何适合 AI 辅助软件工程,认为代码生成交给 AI 之后,软件工程的瓶颈已从写代码转向审查、验证与维护。
Google 开源了 C++ 库 Credentio,用于在本地验证 C2PA 内容凭证,初期支持规范 2.2 和 2.4 版本。该库已在近 40 款 Google 产品中处理数百亿个图像、视频、音频和文档资产,验证在开发者应用本地完成,无需将媒体文件传回 Google 或外部验证端点,以降低延迟、带宽与隐私限制。
HeyGen 与 Google Cloud 把 18B 参数的 Avatar IV 移植到八芯片 Trillium(v6e)主机,提速 1.86×。Avatar IV 是驱动说话头视频的扩散模型栈,以 Web 和 API 提供 720p/1080p、25fps 流式渲染。迁移经 torchax 前端完成,性能接近 8×H100 生产环境,视频成本效率最高提升 25%。
Google 开发者博客发布指南,介绍如何用 Agent Development Kit(ADK)构建零信任 AI 智能体。文章给出三层防护实现:Cloud KMS 硬件密钥为每次数据库写入签名、gVisor 用户态沙箱隔离动态生成代码、确定性语义网关在模型调用和写库前后做规则校验,并把安全策略写成 CI/CD 中的回归测试。
推荐理由:文章给出可用 HMAC 本地复现的三层防护实现,读者可据此核对自家智能体写库与代码执行的信任边界。
Google 在 ADK 中加入原生实时评估,可用模拟用户以语音驱动语音智能体并对回复打分,复用已有的文本智能体评估循环。
Google Cloud 将原生 TPU 支持集成进 vLLM,在 Cloud TPU 上实现企业级精度的长上下文多模态嵌入推理。该方案以 Qwen3-Embedding-8B 为目标模型,支持文本 4K+ tokens、多模态文本加图像 15K+ tokens 的超长上下文,并以余弦相似度验证跨硬件数值对齐,文本目标阈值 ≥0.999、多模态 ≥0.995。
深度学习和 Keras 正被用于解码天体粒子物理的宇宙信号,宇宙线、伽马射线和中微子由跨数千平方公里的观测站以纳秒分辨率记录成波形。Pierre Auger Observatory 的 1500 多个探测器站覆盖 3000 km²,IceCube 用约 1 km³ 南极冰探测中微子。10¹⁹ eV 以上粒子通量仅每平方公里每世纪约 100 个,深度学习可提升仪器灵敏度并发现隐藏模式。
Google for Startups AI Agents Challenge 结束后,Google 从各赛道排名靠前的提交中总结出四个工程模式,分别是以 MCP 双向暴露工具、事件驱动并发、备用模型走同一校验函数和分级路由。
推荐理由:从真实挑战赛代码提交中提炼出四个可复用的智能体工程模式,覆盖 MCP 双向暴露、事件驱动并发与分级路由。
Google Cloud 的 Gemini Enterprise DevEx 计划以 Sprint 形式按开发者真实路径压测自家工具,本轮聚焦智能体治理,梳理出身份预置、Agent Registry 注册、Agent Gateway 绑定、政策与 Model Armor 内容安全、请求验证 5 条端到端工作流。
ADK for Kotlin 1.0 正式 GA,与 ADK 1.0 Core 功能对齐并补齐 Android 优先的端侧扩展。框架基于 Kotlin Multiplatform(KMP)核心,可用 LiteRT-LM、ML Kit(beta)端侧运行智能体,经 Firebase AI Logic 编排混合云工作流,以 Room 和 AppSearch 跨进程重启持久化状态。
Google Developers Blog 发文介绍 AI 编码智能体的 harness 工程实践,主张用行为评测补充 Terminal-Bench、DeepSWE 这类端到端跑分。
Google 团队发布 autofinetune,把自治研究循环用于 LLM 后训练,智能体在 Tunix、Gemma 和 Cloud TPU 上自动改脚本、跑训练并保留或回滚实验。
Gemini Enterprise Agent Platform 的 Agent Anomaly Detection 进入 Private Preview,这套基于推理的监督与审计层通过 reasoning traces、tool calls 和执行流标记智能体的行为异常与策略违规。
Google 宣布与 Speakeasy 合作,将其 OpenAPI 代码生成套件以 AGPLv3 协议开源。开源内容包括覆盖 Python、TypeScript、Go、Java、C#、PHP、Ruby 7 种语言的 SDK 生成器、CLI 生成器和文档 MCP server 生成器,生成的代码仍可沿用 MIT 或 Apache 2.0 等自选许可。
Google AI 订阅用户现在可获得 Colab 高级权益,包括优先使用更快的加速器和算力更强的机器。Google AI Ultra 订阅者还可解锁不间断后台执行和 Premium GPU 访问,长时间训练无需保持浏览器标签页打开。相关权益将在未来几周内在支持 Colab 的国家和地区陆续推送,已订阅 Colab 的用户不受影响,且两类订阅权益可以叠加。
Google 宣布 Antigravity SDK 支持本地模型工作流,初期可通过 Google AI Edge 的 LiteRT 运行 Gemma 4 26B A4B,在完全离线状态下提供智能体辅助。
推荐理由:Antigravity SDK 把本地模型接入智能体工作流,读者可据此判断离线运行与云端混合编排的成本和隐私取舍。
Google MaxText 团队在 Cloud TPU 上从头复现了 Ai2 的 Olmo 3 7B 预训练与中期退火,阶段 1、阶段 2 的损失曲线与 Ai2 公开参考在留出评估上对齐。
Google Cloud API Gateway 进入 Public Preview,可直接充当远程 MCP 服务器,把已部署的 OpenAPI REST 操作暴露为智能体可调用的 MCP 工具,无需另外搭建和维护服务器。
推荐理由:文中给出把既有 REST API 直接改造成 MCP 工具的配置方式与已知限制,便于判断这类改造是否适合现有服务。
Google Research 提出 AI video co-director,一个构建在 Gemini 和 Veo 之上的统一多智能体编排框架,用于自动化生成跨镜头连贯的分钟级长视频。
Google Beam 扩展至美国、加拿大、英国、法国、德国和日本六个国家,并由 18 家渠道合作伙伴支持部署。Google 与 Industrious 合作推出首个 Beam 扩展网络,10 月起可在美国部分 Industrious 地点预约体验。八周内部研究显示,使用 Beam 的 Google 团队连接感提升 50%、后续会议需求下降 21%。
Google Research 提出 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实基准,源代码和文档已在 GitHub 发布。中段物流覆盖最长距离且占物流总支出很大部分,但长期缺乏公开高质量数据,物流公司通常将网络拓扑和需求量视为敏感专有信息。MilleMiglia 可生成兼顾隐私的真实数据,模拟货物在配送中心换乘不同车辆、按时间窗接驳的接力运输。
Google 扩大 AI & Economy Research Program,邀请 2025 年诺贝尔经济学奖得主 Philippe Aghion 出任学术顾问,Ajay Agrawal 出任访问学者。
Google Envisioning Studio 在 Google Labs 支持下与设计师 Jane Wade、Sergio Hudson 合作,用 Google Flow 打造的两款定制工具已用于纽约时装周。
Google 发布生成式 UI(GenUI)教育研究实验,教师可创建贴合自身课程目标的定制互动教学模拟,界面与内容动态生成。同时开放 30 多个英语 STEM 学习互动示例库,覆盖物理、化学、生物、数学,面向初高中,均由 AI 生成、教师审核。
联合国系统在 Google 支持下推出 UN System Data Commons,一个基于 Data Commons 构建的开源平台,把联合国各机构分散的全球统计数据整合为可搜索的 AI-ready 知识图谱。
Emerald AI、Google 与 NVIDIA 宣布成立 AI 能源管理联盟(AEMA),推动数据中心依据电网状况动态调节用电,以加快 AI 基础设施接入。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习把奖励对齐的查询 fan-out 编译成监督信号,蒸馏进仅 53.9M 参数的扩散检索器,实现单次非自回归查询扩展。该框架微调 Gemma3-4B 和 Qwen3-4B,以集合级奖励评估整组结果,绕开零样本 LLM 的语义重复与数百个 CoT 推理 token 带来的自回归延迟。
Google 介绍其语言技术已支持 300 多种语言,其中 Gemini 3.5 Live Translate 覆盖 70 种语言、2000 多个语言对,可实时翻译并处理语码转换和情绪线索。
Google 正与全球各地社区和研究者合作,把 AI 用于让疾病可检测、可治疗、可预防,预测自然灾害,扩大学习机会并为更多人打开经济机会。AI 已从理论研究走向可衡量的现实影响,这一合集展示了专家与本地领导者如何借助 AI 突破,让更多人共享 AI 机遇。
Cloudflare 推出 Disallow AI Training 设置,网站可在保留搜索收录的同时拒绝同一爬虫把内容用于 AI 训练,Apple、Google、Microsoft 已遵守或承诺在指定时间内遵守。
推荐理由:Cloudflare 用分级爬虫控制替代一刀切屏蔽,并对比了谷歌、微软、苹果在训练退出上的实际支持程度。
Google 发布 AI & Economy ATLAS 新洞察,并上线开放访问的交互式数据体验,可按职业与国家查看 AI 使用率。与 Google DeepMind、MIT FutureTech 合作的研究显示,近半数受访科学家每天使用 AI,每周节省近 7 小时,但验证 AI 输出和临床验证等环节出现瓶颈。数据还显示印度创意行业 AI 使用率为全球平均的 1.6 倍。
NASA 宇航员 Christina Koch 与 Google 研究、实验室、技术与社会高级副总裁 James Manyika 在 Dialogues on Technology and Society 系列最新一集中对话,探讨太空、技术与发现。
Google Developer Groups 主办的 DevFest 2026 季回归,10 月 1 日至 12 月 31 日在全球 115 个国家举办 800 多场活动。
Google Search 提供三种赛事备战用法:AI Mode 的 Canvas 工具可生成个性化训练计划,连接 YouTube Music 账号后可定制跑步歌单,并可搜索跑鞋、水袋背心等装备。
在纪录片短片《Love, Rendered》中,Google DeepMind 与 Darren Aronofsky 的 Primordial Soup 合作,用 AI 逐帧重现 Burt 与 Ethelle Shatz 结婚 70 余年却未留下影像的相遇记忆。
Google Search 上线 Live Game Feed,搜索进行中的比赛即可看到实时逐回合更新、集锦与 AI 洞察,目前在美国移动端英文版可用。Search 还新增 matchup carousel 与更细的球员、联盟数据,并支持关联 Yahoo Fantasy 或 Sleeper 账户,用 AI Mode 获取首发/替补与 waiver wire 建议。
Google Research 用 UK Biobank 欧洲人群数据向 Biobank Japan 迁移学习,评估跨人群多基因风险评分(PRS)的表现。在八项临床性状上,目标人群样本达 15k 以上时混合欧洲数据反而限制精度提升,仅 5,000 样本时混合 UKB 数据仍有增益。遗传相关性高的性状在目标样本 25-40k+ 前仍受益于混合训练,HDL、LDL 和血糖等高度人群特异性性状受益较小。
Google Research 与 HHMI Janelia 等机构合作,在 Cell 发表完整的雄性果蝇大脑与中枢神经系统连接组图谱,包含超 16.6 万个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。