Google 推出 Fairwind Program,为政府和企业提供主动网络防御
Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构与网络安全伙伴提供 Gemini 3.8 Flash Cyber 加 CodeMender 的自主漏洞发现与修复能力。
Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构与网络安全伙伴提供 Gemini 3.8 Flash Cyber 加 CodeMender 的自主漏洞发现与修复能力。
Google 汇总 8 月 AI 更新,涵盖 Gemini 3.7 Flash、Gemini 3.5 Transcribe、Pixel 11 系列以及 Gemini app 月活突破 10 亿。
Google 提出 MAPL-EMIT 深度学习框架,基于 Swin-S vision transformer 处理 NASA EMIT 卫星高光谱数据,可同时量化甲烷增强、分割羽流范围并定位点源,在专家标注羽流上召回率达 84%。
Google DeepMind 面向 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解功能,将视频分析的 token 消耗降低最多 88%、成本降低最多 66%,准确率提升最多 7%。
推荐理由:原文给出 token 消耗、成本与准确率的对比数据,可用于判断长视频分析的成本结构变化。
Google 推出 Workspace 图像生成与编辑工具 Google Pics,基于 Nano Banana 模型,将在未来几周面向所有 Google AI Pro 和 Ultra 订阅者以及多数 Workspace 企业客户推送。
推荐理由:原文列出对象分割、图中文字编辑等能力与 Workspace 集成计划,可了解图像编辑如何进入现有办公流程。
Google 发布 TimesFM-3,一个原生支持多变量零样本预测的时间序列基础模型,在 Gift-Eval、FEV-Bench 和 Time 三个公开基准上,无论点预测还是概率预测都取得预训练基础模型中的最佳平均排名。
Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可直接从自然语言查询出发,自动完成地理空间数据检索、特征工程到模型训练与评估的全流程,把原先需要数周的人工数据工程缩短到数分钟。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景扩展、首尾帧插值、360p 快速草稿和最高 4K 放大等生成式视频能力,已通过 Gemini API 在 Google AI Studio 上线。
推荐理由:相较于此前只参考最后一秒,Omni 1.1 把场景扩展的前序上下文提高到 10 秒,便于评估长视频工作流的可行性。
Google 为 Search 的 AI Mode 新增机票价格追踪、积分或里程价格查看和酒店预订三项旅行功能。机票价格追踪沿用 Google Flights 的能力,已在 180 多个国家和地区上线,价格来自 300 多家合作航司和旅行网站。
推荐理由:Google 把机票价格追踪、积分比价和酒店预订接入 Search AI Mode,可看搜索入口向交易环节延伸的落点。
Google 联合新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons,试点全球首个针对专有前沿模型的“双盲”评测,把外部评测限制在加密“盒子”内,避免模型提前看到测试题。该评测以 Gemini Flash Lite 在隐私保护环境中运行机密基准,提升评测可信度。其针对的是基准污染问题——模型若提前见过题目,分数会被虚高。
GlucoFM 是面向连续血糖监测(CGM)的自监督基础模型,双流设计分离慢速血糖趋势与短期偏差。它基于 109,066 小时无标注 CGM 数据预训练,在 14 项队列-任务评估中平均 PR-AUC 比最佳 GluFormer 变体高 5.8 个百分点。餐后血糖响应预测中其 MAE 在 Dexcom 和 Libre 上最低,并具备最佳跨数据集迁移能力。
Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe,官方称其为迄今最精确的一版,按 Artificial Analysis 测量,流式平均 WER 为 4.0%、非流式为 2.6%。
Google 在 CHI 2026 发布研究原型 AgentHands,将 LLM 的高层推理映射为与语音同步的手势,用于 XR 中空间化的智能体对话。系统通过眼动与场景重建标记物体,由头显本地解析器按词级时间戳把 TTS 与手势动画对齐。在 N=12 的用户研究中,它对照纯语音基线完成兰花养护与 3D 打印机操作任务,空间定位效果显著提升。
Google 给出 5 种用 Google Search 升级家居装饰的方式:AI Mode 上传房间照片预览家具摆放,Google Lens 拍照找同款复古装饰,Circle to Search 圈选屏幕搜索装饰;Search Live 可语音加摄像头指导 DIY,商品页支持比价、价格历史与降价提醒。
Google 的 Biomarker Discovery Framework 把可穿戴传感器数据中候选生物标志物的筛选组织为人类监督下的多智能体迭代研究闭环。在三个队列共 9,279 条参与者观测上,它自动提出 41 个心理健康与 25 个代谢候选数字生物标志物。
Google DeepMind 回顾 15 年游戏 AI 研究,并与 EVE Universe 背后的独立工作室 Fenris Creations 等游戏开发者合作,为只有 AI 才能实现的新玩法做原型。
Google Research 提出 ME-POIs 框架,将匿名聚合移动性模式与语言模型的地点文本嵌入对齐,生成同时编码地点身份与动态功能的嵌入向量。在公开基准上,该框架对未见地点的访问意图预测相对提升最高 81.9%,价格等级分类提升 75.1%,繁忙度估计准确率提升 24.7%。其流程包含访问对齐、空间多尺度访问传播和文本-移动性协同,用于缓解长尾地点数据稀疏问题。
Google 在 Search 中推出 5 项学习辅助功能,包括交互式可视化、定制练习题、Lens 分步讲解、AI Mode 笔记本和自定义学习文件。练习题支持 ACT、AP、GRE、SAT 等标准化考试,内容来自 The Princeton Review、Careers360、PhysicsWallah 和 Akira Enem 的合作素材,现以英文在全球免费提供。
Google Research 提出 PhotoScan,可用普通手机 2D 照片估算体脂率、A/G 比和 V/S 比三项体成分指标。该框架在 UK Biobank 超过 3.5 万条记录上预训练,再用 677 名成人的手机照片配对 DXA 数据微调,并在 132 人的独立队列中验证。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码和 Agent 的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:原文列出 Gemini 3.7 Flash 相对 3.6 Flash 的多项基准提升与半价定价,便于判断是否值得升级。
Google DeepMind 发布多语言手语转文本模型 SL2T,并在 Gboard 与 Live Transcribe 中上线手语听写功能,先在 Pixel 11 上支持美国手语(ASL)转英文。
推荐理由:SL2T 用 10 万小时、50 多种手语数据训练并直接落到 Gboard 与 Live Transcribe,可作为手语翻译产品化的参考。
Google Research 提出知识画像(knowledge profiling)框架和包含 2,150 条 Wikipedia 事实的 WikiProfile 基准,用于区分 LLM 的事实编码失败与召回失败。
Google Research 发布 AMIE (Video),一个基于 Gemini 和 Project Astra 的实时视频临床问诊系统,由 Talker、Planner、Perception 三个并行智能体组成。
推荐理由:研究用 100 个场景、300 场随机问诊对比 AMIE 视频版与初级保健医生,可了解多智能体架构在实时临床对话中的分工取舍。
Google DeepMind 的 WeatherNext AI 模型在气旋路径、强度和风场结构预测上达到当前最优精度,平均为预报员多争取约一天的有效提前量,成果发表在 Nature。
推荐理由:原文给出气旋路径与强度预测的领先幅度,并公开模型权重与代码,可对照传统预报方法理解改进来源。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并以它构建 Science One Framework 自主研究原型和 CoE Audit 评估协议。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,负责与人类对话、理解物理世界并规划多步任务,再把运动执行交给底层 VLA 模型。
推荐理由:官方给出 Gemini Robotics ER 2 相比 ER 1.6 和前沿模型在进度分类、时刻定位上的指标,读者可据此判断机器人具身推理的当前水平。
Google 在 Google Flow Music 上线最新音乐生成模型 Lyria 3.5,在音乐性、歌词、人声和创作控制四方面均有提升。新模型可生成更丰富复杂的旋律结构,歌词质量更高且提示词遵循与结构感知更好,人声更具表现力与情感、发音更准确。用户还可更便捷地控制输出节奏与时长,即日起可试用。
Google DeepMind 发布 Gemini Robotics 2,由三款模型组成,让机器人实现全身控制、灵巧操作和多机器人协作。其中 Gemini Robotics ER 2 已上线 Google AI Studio 并在 Gemini Enterprise Agent Platform 私密预览,VLA 与端侧模型面向早期接入合作伙伴。
推荐理由:从控制机器人上半身扩展到全身控制,并加入多机协作与端侧快速适配,可了解机器人基础模型的当前能力边界。
Google Research 公布对话式 AI 智能体 SymptomAI 的研究结果,13917 名参与者在随机试验中与五个 Gemini Flash 2.0 SymptomAI 智能体之一完成症状问诊并给出鉴别诊断。
推荐理由:Google 公布 13917 人规模的随机研究,读者可了解主动追问策略如何影响 AI 鉴别诊断的表现。
Google Research 在 Nature 发表强化学习控制量子纠错框架,让智能体从量子错误检测事件中持续学习,在计算过程中实时调节数千个控制参数。在 Willow 超导处理器上注入人工漂移后,纠错码的逻辑稳定性提升 3.5 倍,专家校准后 RL 微调再把逻辑错误率额外压低 20%。该实验将量子存储的逻辑错误降至历史新低。
Google 承诺投入 4000 万美元 AI tokens 和云额度,支持美国能源部 Genesis Mission 加速科学发现。资金向 DOE 国家实验室开放 AlphaEvolve、AlphaFold 3、AlphaGenome 等工具,并提供一年 Gemini for Government 席位与 tokens。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向代码安全的 3.5 Flash Cyber 三款模型。
推荐理由:三款模型同时给出 token 效率、单 token 价格与智能体基准变化,可作为评估智能体工作流成本的参考。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 构建并微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等评测中与体量大得多的模型表现相当。
推荐理由:原文给出该模型在 CyberGym、Chrome 产线扫描等评测中的对比数据,以及仅面向政府和可信伙伴的试点开放方式。
Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,从预防、检测、响应三方面让受信任的政府、科研与生物安全伙伴使用其模型和智能体。
Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力来自 score smoothing,而非偶然。训练中的正则化让神经网络学到的 score function 更平滑,去噪时样本落在训练数据点之间,形成插值生成。1-D 实验中 weight decay 越强 score function 越平滑,无显式正则化时的隐式正则化也有同样效果。
Google DeepMind 启动 Gemini 驱动的 ATL Saathi 试点,为印度 Atal Tinkering Labs 教育者提供 24/7 规划与培训助手,首批覆盖 100 所试点学校。该 web 应用基于 NotebookLM 组织 12 个核心模块内容,支持 8 种语言,并为 10 个核心模块生成项目创意与装配说明。底层使用 Gemini 3.5 Flash。
Google Research 提出大型传感器基础模型 SensorFM,基于 500 万名同意参与者、超过一万亿分钟的无标签多模态可穿戴数据完成预训练。在来自三项研究、共 13985 名参与者、覆盖心血管、代谢、心理健康、睡眠、人口统计和生活方式六类的 35 项健康任务中,冻结编码器加线性探针在 34 项上优于人工特征监督基线。
推荐理由:从超一万亿分钟无标签数据预训练的通用表征,读者可了解它如何在心血管、代谢、睡眠等多类健康任务间迁移。
Google Research 团队在 Nature Cities 发表研究,通过在 10 个美国城市修改 Google Maps 路由算法进行大规模实地实验,发现协调不到 2% 的行程改道即可提升全城驾驶速度并减少排放。
Google DeepMind 与 A24 宣布达成首个研究型合作,双方将建立长期研发协作,让 A24 及其电影人把 Google DeepMind 的技术创新直接嵌入创作流程,帮助艺术家开发新工作流与技术。Google 同时宣布对 A24 进行投资。该合作初期聚焦于连接前沿技术与下一代娱乐,具体目标、技术产出和创意里程碑将随时间演进。
Hugging Face 与 Cerebras 发布一套级联式语音到语音演示,把 Nvidia Parakeet 语音识别、Gemma 4 31B 在 Cerebras 上的推理和 Qwen3TTS 文本转语音串成实时对话链路。