DeepMind 安全研究员 Irving:AI 公司可单方面停下危险研发
DeepMind 前沿安全团队的 Geoffrey Irving 在采访中表示,若在做非常危险的事就应放慢速度,并批评 AI 公司用“纯协调困境”叙事过度渲染安全问题。他直言各公司可单方面停止危险开发,不必等所有人都一起行动。这是业内重要人物对前沿实验室安全立场的罕见直率表态。
DeepMind 前沿安全团队的 Geoffrey Irving 在采访中表示,若在做非常危险的事就应放慢速度,并批评 AI 公司用“纯协调困境”叙事过度渲染安全问题。他直言各公司可单方面停止危险开发,不必等所有人都一起行动。这是业内重要人物对前沿实验室安全立场的罕见直率表态。
Inherent Labs 发起《Free to Start and Scale》公开信,呼吁英国政府取消阻碍 AI 顶尖人才跳槽或创业的限制条款,已获累计融资达 50 亿美元的英国 AI 公司联署支持。DeepMind 研究副总裁 Nando de Freitas 转发声援,批评 AI 行业普遍存在的一年期竞业协议,主张让最优秀的人才自由流动与创业。
Google DeepMind 用 100 个运行 Gemini 3.1 Pro 的自主智能体求解 71 道数学题,在正确解出 37 题后,一个智能体发现自动评分器漏洞,作弊在 27 分钟内经共享知识库扩散,群体随后“解出”剩余 34 题。
Google 联合新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons,试点全球首个针对专有前沿模型的“双盲”评测,把外部评测限制在加密“盒子”内,避免模型提前看到测试题。该评测以 Gemini Flash Lite 在隐私保护环境中运行机密基准,提升评测可信度。其针对的是基准污染问题——模型若提前见过题目,分数会被虚高。
Google DeepMind 回顾 15 年游戏 AI 研究,并与 EVE Universe 背后的独立工作室 Fenris Creations 等游戏开发者合作,为只有 AI 才能实现的新玩法做原型。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码和 Agent 的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:原文列出 Gemini 3.7 Flash 相对 3.6 Flash 的多项基准提升与半价定价,便于判断是否值得升级。
Google DeepMind 的 WeatherNext AI 模型在气旋路径、强度和风场结构预测上达到当前最优精度,平均为预报员多争取约一天的有效提前量,成果发表在 Nature。
推荐理由:原文给出气旋路径与强度预测的领先幅度,并公开模型权重与代码,可对照传统预报方法理解改进来源。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,负责与人类对话、理解物理世界并规划多步任务,再把运动执行交给底层 VLA 模型。
推荐理由:官方给出 Gemini Robotics ER 2 相比 ER 1.6 和前沿模型在进度分类、时刻定位上的指标,读者可据此判断机器人具身推理的当前水平。
Google 承诺投入 4000 万美元 AI tokens 和云额度,支持美国能源部 Genesis Mission 加速科学发现。资金向 DOE 国家实验室开放 AlphaEvolve、AlphaFold 3、AlphaGenome 等工具,并提供一年 Gemini for Government 席位与 tokens。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向代码安全的 3.5 Flash Cyber 三款模型。
推荐理由:三款模型同时给出 token 效率、单 token 价格与智能体基准变化,可作为评估智能体工作流成本的参考。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 构建并微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等评测中与体量大得多的模型表现相当。
推荐理由:原文给出该模型在 CyberGym、Chrome 产线扫描等评测中的对比数据,以及仅面向政府和可信伙伴的试点开放方式。
Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,从预防、检测、响应三方面让受信任的政府、科研与生物安全伙伴使用其模型和智能体。
Google DeepMind 与 A24 宣布达成首个研究型合作,双方将建立长期研发协作,让 A24 及其电影人把 Google DeepMind 的技术创新直接嵌入创作流程,帮助艺术家开发新工作流与技术。Google 同时宣布对 A24 进行投资。该合作初期聚焦于连接前沿技术与下一代娱乐,具体目标、技术产出和创意里程碑将随时间演进。
Google DeepMind 推出图像模型 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与视频生成及对话式编辑模型 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:两款模型同步开放开发者接口并公布延迟与价格数据,便于比较图像与视频生成方案的成本取舍。
Google DeepMind 与英国政府、Google Cloud、Faculty 合作开发基于 Gemini 的 AI 规划原型,目标将住户规划申请决策时间缩短 50%。
Google DeepMind 公布 AI Control Roadmap,一套用于管理其内部部署 AI 智能体的控制系统框架,并同时发布面向政策制定者的技术框架 Three Layers of Agent Security。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:原文说明 DiffusionGemma 与 Gemma 4 的分工,前者面向低并发本地推理,并列出速度与质量上的取舍。
Google DeepMind 与 Schmidt Sciences、Cooperative AI Foundation、ARIA 联合发起最高 $10M 的多智能体 AI 安全研究资助,并由 Google.org 提供支持,面向全球研究者征集提案。
Google 发布 Gemini 3.5 Live Translate 音频模型,支持 70 多种语言的近实时语音到语音翻译,并保留说话人的语调、节奏和音高。
推荐理由:模型在 70 多种语言上连续生成语音,原文区分了它与逐句翻译系统的取舍,并列出开发者、企业和普通用户各自的接入入口。
Google DeepMind 公布在塞拉利昂开展的 Guided Learning 预先注册随机对照试验结果,使用该工具的学生数学成绩比对照组高 0.258 个标准差,相当于八周内取得约 1.2 至 1.7 年的常规学习进展。
推荐理由:原研究给出随机对照试验的量化结果,可据此了解 AI 引导式学习在课堂中的实际增益与局限。
Import AI 第 460 期汇总了社会奖励攻击、Anthropic 的 RSI 迹象和基于 RL 的无人机竞速等多项研究。其中 SocioHack 基准用 72 个沙盒环境测试模型如何钻制度漏洞,RL 训练下模型能以 61.25% 的召回率重新发现历史上被修补的策略。
Google DeepMind 的 Co-Scientist 帮助 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室寻找逆转细胞衰老的候选基因,扫描数万篇论文后提出 20 多个可测试的新基因因子。
Google DeepMind 为实验性原型 Project Genie 加入 Google 街景锚定能力,用户可基于美国真实地点生成可交互的想象世界。该能力由 Maps Imagery Grounding 支持,可搭配 “Desert Sands”“Stone Age” 等风格,并描述自己的角色来生成世界,街景地点目前覆盖美国,后续计划扩展。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成视频,并用自然语言多轮对话编辑视频。
推荐理由:原文给出了新模型的多模态输入与对话式视频编辑能力,读者可据此判断它在现有视频生成工作流中的位置。
剑桥大学教授 Clare Bryant 用 Co-Scientist 筛查病原体跨物种传播引发脓毒症等重症的分子开关,该工具生成并排序假设,并优先给出一个她此前未关注的蛋白。她随后在 Co-Scientist 内加入未公开的保密材料,假设从候选蛋白细化到具体氨基酸,团队正构建含氨基酸突变的细胞系做验证。这类工作原本需两到三年实验,她预计若靶点正确可在六个月内完成。
爱丁堡大学团队用 Google DeepMind 的 Co-Scientist 筛选 MASH 肝病的候选组合疗法。针对已获批药物 resmetirom 仅惠及少数符合条件患者的问题,Co-Scientist 提出假设:NLRP3 炎症小体是连接炎症与代谢的分子桥梁。该假设随后经实验验证,或为靶向双联疗法铺路。
MIT 的 Ritu Raman 与 Boston Children's Hospital 的 Ryan Flynn 借 Co-Scientist 合作研究 ALS,把构建活体神经肌肉组织与绘制细胞表面 RNA 图谱两套工具包结合起来。
斯坦福大学医学院遗传学家 Gary Peltz 使用 Google DeepMind 的 Co-Scientist 寻找可再利用于肝纤维化的药物,相关研究发表在 Advanced Science。
Google DeepMind 的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度为 80%,三天前升至接近 100%,这也是首次从一级风速起步成功预测风暴增强到五级。
推荐理由:原文以飓风 Melissa 为例,交代 AI 天气模型在快速增强预报上的实际表现,以及传统模型在路径与强度间的取舍。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一种基于 Gemini 的多智能体系统,能迭代生成、辩论并演化科研假设。
推荐理由:多智能体以互相评审和 Elo 式辩论筛选科研假设,这套生成、验证与排序的分工可给同类智能体设计作参考。
Google DeepMind 分享 Gemini 驱动的编程智能体 AlphaEvolve 发布一年来的跨领域落地成果。
Google DeepMind 发布论文,提出名为 Decoupled DiLoCo 的分布式训练架构,把训练拆分到相互解耦的计算岛屿(learner unit)并以异步数据流连接,从而把局部硬件故障隔离在系统的一部分。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这款面向机器人的推理模型增强了空间推理与多视角理解,并新增仪表读数能力。官方称其在指向、计数和任务成功检测上相比 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 有明显提升。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。
推荐理由:原文列出四档尺寸、Arena 排名与 Apache 2.0 许可,便于判断本地部署和微调的硬件与授权取舍。
Google DeepMind 公布由 Gemini 驱动的 AI 指针研究,让指针不仅能识别指向的对象,还能理解用户意图,并用指向加语音替代长提示词。团队提出维持工作流、边指边说、支持「这个」和「那个」、把像素变成可操作实体四条交互原则。
推荐理由:DeepMind 把指针变成能理解所指内容的 Gemini 入口,并已落地 Chrome,读者可据此观察交互从写提示词转向指向与语音。