Google Research 发布 SymptomAI 研究,13917 人参与对话式症状评估试验
Google Research 公布对话式 AI 智能体 SymptomAI 的研究结果,13917 名参与者在随机试验中与五个 Gemini Flash 2.0 SymptomAI 智能体之一完成症状问诊并给出鉴别诊断。
推荐理由:Google 公布 13917 人规模的随机研究,读者可了解主动追问策略如何影响 AI 鉴别诊断的表现。
Google Research 公布对话式 AI 智能体 SymptomAI 的研究结果,13917 名参与者在随机试验中与五个 Gemini Flash 2.0 SymptomAI 智能体之一完成症状问诊并给出鉴别诊断。
推荐理由:Google 公布 13917 人规模的随机研究,读者可了解主动追问策略如何影响 AI 鉴别诊断的表现。
Google Research 在 Nature 发表强化学习控制量子纠错框架,让智能体从量子错误检测事件中持续学习,在计算过程中实时调节数千个控制参数。在 Willow 超导处理器上注入人工漂移后,纠错码的逻辑稳定性提升 3.5 倍,专家校准后 RL 微调再把逻辑错误率额外压低 20%。该实验将量子存储的逻辑错误降至历史新低。
Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力来自 score smoothing,而非偶然。训练中的正则化让神经网络学到的 score function 更平滑,去噪时样本落在训练数据点之间,形成插值生成。1-D 实验中 weight decay 越强 score function 越平滑,无显式正则化时的隐式正则化也有同样效果。
Hume 推出 Real World VoiceEQ 基准,用于评估语音 AI 交互的人类质量,覆盖 40 多款闭源与开源语音模型、15 个以上评测维度和 60 多项指标。该基准基于超 100 万条人工评分构建,含 78.5 万条 TTS 评分与 4.8 万条 STS 评分。评测显示语音模型的说话能力普遍强于聆听能力,没有一种配置在全部八类能力上进入前五,传统基准会高估真实场景表现。
Google Research 提出大型传感器基础模型 SensorFM,基于 500 万名同意参与者、超过一万亿分钟的无标签多模态可穿戴数据完成预训练。在来自三项研究、共 13985 名参与者、覆盖心血管、代谢、心理健康、睡眠、人口统计和生活方式六类的 35 项健康任务中,冻结编码器加线性探针在 34 项上优于人工特征监督基线。
推荐理由:从超一万亿分钟无标签数据预训练的通用表征,读者可了解它如何在心血管、代谢、睡眠等多类健康任务间迁移。
Google Research 团队在 Nature Cities 发表研究,通过在 10 个美国城市修改 Google Maps 路由算法进行大规模实地实验,发现协调不到 2% 的行程改道即可提升全城驾驶速度并减少排放。
DiScoFormer(Density and Score Transformer)用一个 Transformer 在单次前向传播中同时估计数据分布的密度与得分,无需针对新分布重新训练。在 100 维下对比最优手工调参的 KDE,其得分误差降低约 6.5 倍、密度误差降低逾 37 倍。模型以高斯混合模型训练,共享主干配密度与得分双输出头,并可在推理时用一致性损失适配分布外输入。
Google Research 提出把 Multi-Token Prediction(MTP)头接到已冻结的 Gemini Nano v3 主干上,无需为每个任务微调独立的草稿模型即可实现端侧文本生成加速。
Google 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习按访问模式给页面设定 TTL,在内存占用与缓存未命中之间做取舍。集成进 Spanner 生产服务器数月后,内存用量降低 15.5%,缓存未命中仅增 5.5%,总拥有成本(TCO)降低约 5%,且未命中的增加集中在取回成本较低的数据上,I/O 成本影响仅 0.5%。
Google Research 的论文发现,开启推理链能让 LLM 回忆出关闭推理时几乎无法获取的简单单跳事实答案,并在 Gemini-2.5 Flash、Gemini-2.5 Pro 和 Qwen3-32B 上用 pass@k 在 SimpleQA Verified 与 EntityQuestions 上验证。
Google Earth AI 将 Farmscapes 2020 的英格兰高分辨率地图转为矢量化生态数据集,把树篱、石墙和小树林等标准卫星难以探测的细尺度特征变成可用于景观修复与碳核算的清单。模型以 RSF 在超 3 亿张全球卫星影像上预训练的 ViT 为骨干,仅用约 247 km² 标注数据微调,并用 Polsby–Popper 紧凑度分数区分细长树篱与成片林地。
Google DeepMind 公布 AI Control Roadmap,一套用于管理其内部部署 AI 智能体的控制系统框架,并同时发布面向政策制定者的技术框架 Three Layers of Agent Security。
Google 分享其关于消费者使用 AI 工具理解皮肤问题的研究:发表于 JAMA Dermatology 的 2,345 人调查显示,AI 辅助让参与者猜测病症名称的准确率从对照组的 8% 升至 23%,“Wizard of Oz”组达 36%。
Google Research 提出 Regularized f-Divergence Kernel Tests,一个用相对距离检验审计机器遗忘的新框架,论文在 AISTATS 2026 发表。
Google DeepMind 公布在塞拉利昂开展的 Guided Learning 预先注册随机对照试验结果,使用该工具的学生数学成绩比对照组高 0.258 个标准差,相当于八周内取得约 1.2 至 1.7 年的常规学习进展。
推荐理由:原研究给出随机对照试验的量化结果,可据此了解 AI 引导式学习在课堂中的实际增益与局限。
Google Research 在 Nature 发表研究,提出 PHRM 系统,可在日常使用手机时后台监测心率(HR)与静息心率(RHR)。该系统利用前置摄像头在面部解锁后的数秒内拍摄视频,通过端侧深度学习估计心率,与 ECG 相比 MAPE 低于 10%,符合所有肤色人群的行业精度标准,日 RHR 与 Fitbit Charge 6 相比 MAE 为 4.39 bpm。
推荐理由:论文公开了 PHRM 的跨肤色误差数据与大样本数据集规模,读者可对照可穿戴设备理解被动健康监测的量化标准。
Google 公布基于零信任原则的隐私分析方案:新加密协议让设备只需提交单条消息即可完成安全聚合,无需长时间保持在线。该方案集成进 Google 的 confidential federated analytics,并与 TEE 结合形成多层防护,即使 TEE 安全模型失效数据也不会泄露。
Google 在 Nature 发表论文介绍 ERA,这是用 Gemini 为科学家编写和优化科学代码的研究工具,在基因组学、公共卫生、卫星图像分析、神经科学预测、通用时间序列预测和数学等基准上达到专家级表现。
推荐理由:ERA 在基因组学、公共卫生等多个基准上达到专家级表现,正文另列出八项已发表的跨学科科研应用。
Calico Life Sciences 用 Google Co-Scientist 生成关于整合应激反应(ISR)如何受代谢调控的新颖假说,实验由此获得对 ISR 与健康、疾病关系有重要意义的新发现。
爱丁堡大学团队用 Google DeepMind 的 Co-Scientist 筛选 MASH 肝病的候选组合疗法。针对已获批药物 resmetirom 仅惠及少数符合条件患者的问题,Co-Scientist 提出假设:NLRP3 炎症小体是连接炎症与代谢的分子桥梁。该假设随后经实验验证,或为靶向双联疗法铺路。
斯坦福大学医学院遗传学家 Gary Peltz 使用 Google DeepMind 的 Co-Scientist 寻找可再利用于肝纤维化的药物,相关研究发表在 Advanced Science。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一种基于 Gemini 的多智能体系统,能迭代生成、辩论并演化科研假设。
推荐理由:多智能体以互相评审和 Elo 式辩论筛选科研假设,这套生成、验证与排序的分工可给同类智能体设计作参考。
Google DeepMind 发布 AI co-clinician 医疗研究计划,探索在医生监督下由 AI 智能体参与患者问诊的三元照护模式。研究在 98 条真实初级保健查询中有 97 条无关键错误,并在 140 项问诊技能评估中于 68 项达到或超过初级保健医生水平,专家医生整体表现仍更好。
推荐理由:文章以 140 项问诊技能的盲评对比,呈现 AI co-clinician 与初级保健医生的能力差异和仍待改进之处。
Google Research 发文总结科学家使用 Empirical Research Assistance(ERA)在公共卫生、宇宙学、气候和神经科学四个方向的进展。
Google DeepMind 发布论文,提出名为 Decoupled DiLoCo 的分布式训练架构,把训练拆分到相互解耦的计算岛屿(learner unit)并以异步数据流连接,从而把局部硬件故障隔离在系统的一部分。
Google Research 提出的 ReasoningBank 让智能体从成功与失败经验中提炼高层推理模式,实现测试时自我演化。在 Gemini-2.5-Flash 上,WebArena 成功率比无记忆基线高 8.3%,SWE-Bench-Verified 高 4.6%,每任务少用近 3 个执行步骤。配套的 MaTTS 通过并行与串行扩展,把探索轨迹也转化为高质量记忆。
Google Research 提出推理优先的合成数据框架 Simula,不依赖种子数据,可从第一性原理构建完整数据集。该框架用全局多样化、局部多样化、复杂化与双 critic 质量校验四步控制生成。
Google Research 用合成神经元形状增强 PATHFINDER 训练数据,将小鼠轴突重建误差降低 4.4%。其 MoGen 模型基于 PointInfinity 点云流匹配,用 1,795 个小鼠皮层轴突训练,训练数据加入 10% 合成形状即可减少合并错误。MoGen 已开源,论文将在 ICLR 2026 发表;按完整小鼠脑规模计算,相当于节省 157 人年人工校对。
Google Research 提出 ConvApparel 数据集,用 4000+ 段、近 15000 轮服装购物人机对话量化并弥合 LLM 用户模拟器的真实感差距。
Google Research 提出基于情境判断测试(SJT)的框架,评估 25 个 LLM 的行为倾向与人类共识的对齐程度。结果显示两类差距:模型倾向会偏离人类标注共识,且在人类无共识时无法覆盖其意见分布。人类标注一致时大规模与前沿闭源模型接近满分,共识低于 90% 时停滞在 80% 出头。
Google Research 的“Forest vs Tree”研究指出,AI 评测常用的每项 1–5 名标注者标准不足,往往需要超过 10 名标注者。基于 Toxicity 等数据集的模拟显示,最优配比取决于指标:多数投票准确率偏向增加条目,捕捉意见分布则需增加标注者;约 1,000 条总标注即可实现高可复现性,模拟器已在 GitHub 开源。
Google 推出 TurboQuant,一种零精度损失的压缩算法,可同时压缩 KV cache 并加速向量搜索。它先用 PolarQuant 随机旋转向量完成主体压缩,再用 1 bit 的 QJL 消除残差误差,TurboQuant 将在 ICLR 2026 展示。
Google Research 提出自监督框架 S2Vec,用 S2 Geometry 分区加特征栅格化把建成环境转为多层图像,再以掩码自编码(MAE)学习通用嵌入向量。在社会经济预测中,S2Vec 在零样本地理外推任务(如 US-wide 人口密度、收入中位数)上常为最佳单一模型,与图像嵌入做多模态融合后优于单模态。树覆盖、海拔等环境任务仍有待改进。
Google 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项论文,分别评估 AI 乳腺癌筛查系统的独立性能及其作为第二读片人嵌入双读流程的效果。
推荐理由:两项研究给出了AI作为第二读片人的性能数据与部署细节,可供评估AI嵌入既有人工复核流程的可行性与难点。
Google 与康奈尔大学合作,用 67 道高温超导专家级问题评测 6 个 LLM,NotebookLM 和自建 RAG 系统表现最佳。被评测的还有 GPT-4o、Perplexity、Claude 3.5 和 Gemini Advanced Pro 1.5;NotebookLM 在视角平衡、全面性与证据支撑上得分最高,但最不简洁。论文发表于 PNAS,封闭系统使用 1,726 篇来源。
Google 推出 Groundsource,用 Gemini 从多语言新闻报道中抽取洪水事件,并开放首个城市山洪数据集,包含 260 万条记录、覆盖 150 多个国家、时间跨度从 2000 年至今。
Google Research 与 Beth Israel Deaconess Medical Center 合作,在真实门诊流程中开展 AMIE 对话式诊断 AI 的前瞻性单中心可行性研究,100 名成年患者就诊前通过安全网页链接与 AMIE 进行文本问诊,全程由医生视频监督,未触发任何安全中止。
推荐理由:研究以盲评方式对比 AMIE 与初级保健医生的鉴别诊断和管理计划质量,为对话式医疗 AI 的真实落地提供参照。
Mistral AI 发布 LLM 全生命周期环境足迹研究,与 Carbone 4、法国生态转型署 ADEME 合作完成,并由 Resilio 和 Hubblo 复核。
推荐理由:Mistral 公布模型训练与推理的环境足迹核算口径及具体数据,可供评估 AI 环境影响时对照参考。
哈佛大学团队发布 Wake Vision 数据集,约 600 万张图像,规模约为 TinyML 人物检测数据集 VWW 的 100 倍。数据集分为侧重规模的 Large 与侧重标注质量的 Quality 两个训练集,精度较 VWW 最高提升 6.6%,人工标注验证下错误率从 7.8% 降至 2.2%。
Google Research 健康 AI 团队展示如何用 TensorFlow Lite 在手机上运行孕龄与胎位评估模型,让只接受几小时培训、没有超声背景的人员通过盲扫协议采集视频就能得到与标准诊疗相当的预测结果。