Google 发布 Gemini 3.5 Live Translate 实时语音翻译模型
Google 发布 Gemini 3.5 Live Translate 音频模型,支持 70 多种语言的近实时语音到语音翻译,并保留说话人的语调、节奏和音高。
推荐理由:模型在 70 多种语言上连续生成语音,原文区分了它与逐句翻译系统的取舍,并列出开发者、企业和普通用户各自的接入入口。
Google 发布 Gemini 3.5 Live Translate 音频模型,支持 70 多种语言的近实时语音到语音翻译,并保留说话人的语调、节奏和音高。
推荐理由:模型在 70 多种语言上连续生成语音,原文区分了它与逐句翻译系统的取舍,并列出开发者、企业和普通用户各自的接入入口。
Google DeepMind 发布 Gemma 4 12B,一款无编码器的多模态模型,可在笔记本本地运行。该模型把视觉输入改为单次矩阵乘法的轻量嵌入模块,并去掉音频编码器,将原始音频信号投影到与文本 token 相同的维度,是 Gemma 4 系列首款支持原生音频输入的中等规模模型。
推荐理由:Gemma 4 12B 用无编码器架构让视觉和音频直接进入 LLM,性能接近 26B MoE 而内存占用不到一半。
Google DeepMind 启动为期三个月的 Robotics 加速器项目,选出 15 家欧洲机器人初创公司,提供技术指导并开放 AI 栈与 Gemini 机器人模型。入选公司覆盖物流、制造、医疗、气候与导航等领域,其中 3D-Components 称其 RobTrack 将焊接和金属 3D 打印的参数选择与质控提速 280X。项目本周在伦敦启动。
Google DeepMind 公布在塞拉利昂开展的 Guided Learning 预先注册随机对照试验结果,使用该工具的学生数学成绩比对照组高 0.258 个标准差,相当于八周内取得约 1.2 至 1.7 年的常规学习进展。
推荐理由:原研究给出随机对照试验的量化结果,可据此了解 AI 引导式学习在课堂中的实际增益与局限。
Google 在 Gemini Enterprise Agent Platform 上线基于 Agentic RAG 的跨语料检索(Cross-Corpus Retrieval),现已开放公开预览。
Google Research 在 Nature 发表研究,提出 PHRM 系统,可在日常使用手机时后台监测心率(HR)与静息心率(RHR)。该系统利用前置摄像头在面部解锁后的数秒内拍摄视频,通过端侧深度学习估计心率,与 ECG 相比 MAPE 低于 10%,符合所有肤色人群的行业精度标准,日 RHR 与 Fitbit Charge 6 相比 MAE 为 4.39 bpm。
推荐理由:论文公开了 PHRM 的跨肤色误差数据与大样本数据集规模,读者可对照可穿戴设备理解被动健康监测的量化标准。
Google Research 在 GitHub 以 Apache 2.0 协议开源其水文建模框架,供各国气象水文机构在自己的流程中训练 AI 洪水预报模型。
Google 在 I/O 2026 发布 Gemini for Science 实验性工具套件,其中 Computational Discovery 基于 ERA 与 AlphaEvolve,可并行生成并评分数千个代码变体,Hypothesis Generation 则由 Co-Scientist 构建。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,联合 Airbus、BMW 和 ASML 优化设计、仿真与生产,并强调对专有数据、IP 和生产环境的完全控制。
Mistral 发布统一 AI 智能体 Vibe,Le Chat 更名为 Vibe,把工作与编码合并为同一智能体和同一授权,原有对话、设置和套餐随之保留。
推荐理由:Le Chat 更名并整合为工作与编码双模式的智能体,可对照其分档定价与 VS Code 接入了解产品定位。
Mistral AI 发布 Search Toolkit 公开预览版,这是把数据接入、检索和评测整合到同一配置接口的开源框架,可运行在云、本地和边缘环境。它内置 BM25 稀疏检索、稠密向量检索与混合配置,并提供 recall、precision、MRR、NDCG 评测指标,可在自有测试集上对比不同检索配置。
Google 公布基于零信任原则的隐私分析方案:新加密协议让设备只需提交单条消息即可完成安全聚合,无需长时间保持在线。该方案集成进 Google 的 confidential federated analytics,并与 TEE 结合形成多层防护,即使 TEE 安全模型失效数据也不会泄露。
Mistral 将 Emmi AI 并入,构建面向 AI 原生工业工程的物理 AI 基础能力。该模型从几何与边界条件直接预测物理场,单 GPU 上单次前向传播即可秒级完成,而传统 CFD/FEM 每个设计变体需数小时到数周。合作伙伴包括 ASML、Airbus、Safran 与 Siemens Energy。
Mistral 收购 Emmi AI,加码面向航空航天、汽车、半导体和能源等行业的 Physics AI 基础模型研究。其已发布突破包括 AB-UPT,可在单块 GPU 上处理 9M 表面和 140M 体积网格单元、无需重新网格化的空气动力学 CFD 模型。NeuralDEM 则是首个面向大规模多物理过程的端到端深度学习代理模型,可实时仿真流化床反应器等工业过程。
Mistral AI 已签署最终协议收购 Physics AI 先驱 Emmi AI,以强化其工业企业 AI 转型伙伴地位。Emmi AI 总部位于奥地利,其大工程模型可将多日计算替换为实时仿真并构建数字孪生,30 多名研究员和工程师将于 5 月加入 Mistral AI 的 Science 与 Applied AI 团队。
Mistral 发布 Mistral Medium 3.5,这是一个 128B 稠密模型,以开源权重、修改版 MIT 许可发布,并成为 Mistral Vibe 和 Le Chat 的默认模型。
推荐理由:把编码智能体迁到云端并以 128B 开源权重模型驱动,读者可据此判断自托管部署与异步并行任务的成本变化。
Mistral 在 Studio 发布 Connectors(公开预览),内置连接器和自定义 MCP 现在都能通过 API/SDK 用于所有模型与智能体调用。新增的直接工具调用让开发者自行决定何时调用工具,requires_confirmation 可在工具执行前插入人工审批。连接器集中注册后可在 LeChat 与 AI Studio 中复用,Vibe 也即将支持。
推荐理由:Mistral 把企业数据集成封装成可复用的连接器,读者可据此评估自建 Agent 集成层的重复维护成本。
Google DeepMind 在亚太推出 Accelerator 加速器计划,聚焦“AI for the Planet”。为期三个月的计划面向创业公司、研究团队和非营利组织,提供专家指导、定制支持,并协助集成 Google AI 的前沿 AI 与科学 AI 模型。计划以新加坡线下 bootcamp 启动,现已开放意向登记。
Google 在 Nature 发表论文介绍 ERA,这是用 Gemini 为科学家编写和优化科学代码的研究工具,在基因组学、公共卫生、卫星图像分析、神经科学预测、通用时间序列预测和数学等基准上达到专家级表现。
推荐理由:ERA 在基因组学、公共卫生等多个基准上达到专家级表现,正文另列出八项已发表的跨学科科研应用。
Google DeepMind 的 Co-Scientist 帮助 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室寻找逆转细胞衰老的候选基因,扫描数万篇论文后提出 20 多个可测试的新基因因子。
Google DeepMind 为实验性原型 Project Genie 加入 Google 街景锚定能力,用户可基于美国真实地点生成可交互的想象世界。该能力由 Maps Imagery Grounding 支持,可搭配 “Desert Sands”“Stone Age” 等风格,并描述自己的角色来生成世界,街景地点目前覆盖美国,后续计划扩展。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成视频,并用自然语言多轮对话编辑视频。
推荐理由:原文给出了新模型的多模态输入与对话式视频编辑能力,读者可据此判断它在现有视频生成工作流中的位置。
Google 发布 Gemini for Science,在 Google Labs 上线 Hypothesis Generation、Computational Discovery、Literature Insights 三个科学实验原型,并推出可在 Google Antigravity 使用的 Science Skills。
Google 把 SynthID 的图像、视频和音频验证扩展到搜索,并将在未来几周进入 Chrome,该能力此前已在 Gemini 应用中累计使用 5000 万次。
推荐理由:在生成媒体普及的背景下,SynthID 已为超 1000 亿件图像视频加上水印,读者可了解各产品验证入口的分批上线节奏。
Google DeepMind 与新加坡政府推进国家 AI 合作,落地医疗、教育与科研项目,包括 AI co-clinician、Gemma 驱动的盲人跑者助手,以及面向教育工作者的 Gemini for Education。合作称到 2040 年加快研发可为新加坡带来额外 S$3.3 billion 经济价值。
剑桥大学教授 Clare Bryant 用 Co-Scientist 筛查病原体跨物种传播引发脓毒症等重症的分子开关,该工具生成并排序假设,并优先给出一个她此前未关注的蛋白。她随后在 Co-Scientist 内加入未公开的保密材料,假设从候选蛋白细化到具体氨基酸,团队正构建含氨基酸突变的细胞系做验证。这类工作原本需两到三年实验,她预计若靶点正确可在六个月内完成。
Calico Life Sciences 用 Google Co-Scientist 生成关于整合应激反应(ISR)如何受代谢调控的新颖假说,实验由此获得对 ISR 与健康、疾病关系有重要意义的新发现。
爱丁堡大学团队用 Google DeepMind 的 Co-Scientist 筛选 MASH 肝病的候选组合疗法。针对已获批药物 resmetirom 仅惠及少数符合条件患者的问题,Co-Scientist 提出假设:NLRP3 炎症小体是连接炎症与代谢的分子桥梁。该假设随后经实验验证,或为靶向双联疗法铺路。
MIT 的 Ritu Raman 与 Boston Children's Hospital 的 Ryan Flynn 借 Co-Scientist 合作研究 ALS,把构建活体神经肌肉组织与绘制细胞表面 RNA 图谱两套工具包结合起来。
斯坦福大学医学院遗传学家 Gary Peltz 使用 Google DeepMind 的 Co-Scientist 寻找可再利用于肝纤维化的药物,相关研究发表在 Advanced Science。
Google DeepMind 的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度为 80%,三天前升至接近 100%,这也是首次从一级风速起步成功预测风暴增强到五级。
推荐理由:原文以飓风 Melissa 为例,交代 AI 天气模型在快速增强预报上的实际表现,以及传统模型在路径与强度间的取舍。
Google DeepMind 发布 Gemini 3.5 模型系列,首个版本 3.5 Flash 今天起在 Gemini 应用、Google Search 的 AI Mode、Google Antigravity 和 Gemini API 开放,3.5 Pro 已在内部使用并计划下月推出。
推荐理由:原文用 Terminal-Bench 2.1、MCP Atlas 等基准与 4 倍输出速度做横向对比,读者可据此判断速度与智能体能力能否兼得。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一种基于 Gemini 的多智能体系统,能迭代生成、辩论并演化科研假设。
推荐理由:多智能体以互相评审和 Elo 式辩论筛选科研假设,这套生成、验证与排序的分工可给同类智能体设计作参考。
Google DeepMind 分享 Gemini 驱动的编程智能体 AlphaEvolve 发布一年来的跨领域落地成果。
Google DeepMind 发布 AI co-clinician 医疗研究计划,探索在医生监督下由 AI 智能体参与患者问诊的三元照护模式。研究在 98 条真实初级保健查询中有 97 条无关键错误,并在 140 项问诊技能评估中于 68 项达到或超过初级保健医生水平,专家医生整体表现仍更好。
推荐理由:文章以 140 项问诊技能的盲评对比,呈现 AI co-clinician 与初级保健医生的能力差异和仍待改进之处。
Google Research 发文总结科学家使用 Empirical Research Assistance(ERA)在公共卫生、宇宙学、气候和神经科学四个方向的进展。
Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,用于把 AI 驱动的流程稳定投入生产。Workflows 基于 Temporal 的持久化执行引擎构建,提供持久化执行、可观测性和单行代码的人工审批,并针对 AI 负载扩展了流式处理、负载处理与可观测性;控制平面由 Mistral 托管,workers 部署在企业自己的 Kubernetes 环境。
Google 将一套 3D 感知的照片重构图方法上线到 Google Photos 的 Auto frame 功能,可自动调整相机视角并补全原本未拍到的画面。该方法先用内部 3D 点图估计模型获取每个像素的 3D 点并估算原相机焦距,再用生成式潜空间扩散模型填补新视角渲染后出现的空缺。
推荐理由:相较裁剪和缩放,这套方法把照片还原成 3D 场景并重设相机视角,可了解生成式修图的一种实现路径。
Google DeepMind 发布论文,提出名为 Decoupled DiLoCo 的分布式训练架构,把训练拆分到相互解耦的计算岛屿(learner unit)并以异步数据流连接,从而把局部硬件故障隔离在系统的一部分。
Google Research 提出的 ReasoningBank 让智能体从成功与失败经验中提炼高层推理模式,实现测试时自我演化。在 Gemini-2.5-Flash 上,WebArena 成功率比无记忆基线高 8.3%,SWE-Bench-Verified 高 4.6%,每任务少用近 3 个执行步骤。配套的 MaTTS 通过并行与串行扩展,把探索轨迹也转化为高质量记忆。