Google DeepMind 在 Nature 发表 Co-Scientist 多智能体科研系统
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一种基于 Gemini 的多智能体系统,能迭代生成、辩论并演化科研假设。
推荐理由:多智能体以互相评审和 Elo 式辩论筛选科研假设,这套生成、验证与排序的分工可给同类智能体设计作参考。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一种基于 Gemini 的多智能体系统,能迭代生成、辩论并演化科研假设。
推荐理由:多智能体以互相评审和 Elo 式辩论筛选科研假设,这套生成、验证与排序的分工可给同类智能体设计作参考。
Institute for Law & AI 研究者提出「radical optionality」,主张政府避免过度监管、提前建设机构与法律授权。建议包括透明度与报告要求、审计机制、举报人保护、评估能力,并加大对 AISI(英国)与 CAISI(美国)的资助。Meta 与 KAIST 的 Neural Computers 提出在习得运行时状态中统一计算、记忆与 I/O 的神经计算机。
Google DeepMind 发布 AI co-clinician 医疗研究计划,探索在医生监督下由 AI 智能体参与患者问诊的三元照护模式。研究在 98 条真实初级保健查询中有 97 条无关键错误,并在 140 项问诊技能评估中于 68 项达到或超过初级保健医生水平,专家医生整体表现仍更好。
推荐理由:文章以 140 项问诊技能的盲评对比,呈现 AI co-clinician 与初级保健医生的能力差异和仍待改进之处。
Google Research 发文总结科学家使用 Empirical Research Assistance(ERA)在公共卫生、宇宙学、气候和神经科学四个方向的进展。
Google DeepMind 发布论文,提出名为 Decoupled DiLoCo 的分布式训练架构,把训练拆分到相互解耦的计算岛屿(learner unit)并以异步数据流连接,从而把局部硬件故障隔离在系统的一部分。
Google Research 提出的 ReasoningBank 让智能体从成功与失败经验中提炼高层推理模式,实现测试时自我演化。在 Gemini-2.5-Flash 上,WebArena 成功率比无记忆基线高 8.3%,SWE-Bench-Verified 高 4.6%,每任务少用近 3 个执行步骤。配套的 MaTTS 通过并行与串行扩展,把探索轨迹也转化为高质量记忆。
Google Research 提出推理优先的合成数据框架 Simula,不依赖种子数据,可从第一性原理构建完整数据集。该框架用全局多样化、局部多样化、复杂化与双 critic 质量校验四步控制生成。
Google Research 用合成神经元形状增强 PATHFINDER 训练数据,将小鼠轴突重建误差降低 4.4%。其 MoGen 模型基于 PointInfinity 点云流匹配,用 1,795 个小鼠皮层轴突训练,训练数据加入 10% 合成形状即可减少合并错误。MoGen 已开源,论文将在 ICLR 2026 发表;按完整小鼠脑规模计算,相当于节省 157 人年人工校对。
Google Research 提出 ConvApparel 数据集,用 4000+ 段、近 15000 轮服装购物人机对话量化并弥合 LLM 用户模拟器的真实感差距。
Google Research 提出基于情境判断测试(SJT)的框架,评估 25 个 LLM 的行为倾向与人类共识的对齐程度。结果显示两类差距:模型倾向会偏离人类标注共识,且在人类无共识时无法覆盖其意见分布。人类标注一致时大规模与前沿闭源模型接近满分,共识低于 90% 时停滞在 80% 出头。
Google Research 的“Forest vs Tree”研究指出,AI 评测常用的每项 1–5 名标注者标准不足,往往需要超过 10 名标注者。基于 Toxicity 等数据集的模拟显示,最优配比取决于指标:多数投票准确率偏向增加条目,捕捉意见分布则需增加标注者;约 1,000 条总标注即可实现高可复现性,模拟器已在 GitHub 开源。
Google 推出 TurboQuant,一种零精度损失的压缩算法,可同时压缩 KV cache 并加速向量搜索。它先用 PolarQuant 随机旋转向量完成主体压缩,再用 1 bit 的 QJL 消除残差误差,TurboQuant 将在 ICLR 2026 展示。
Google Research 提出自监督框架 S2Vec,用 S2 Geometry 分区加特征栅格化把建成环境转为多层图像,再以掩码自编码(MAE)学习通用嵌入向量。在社会经济预测中,S2Vec 在零样本地理外推任务(如 US-wide 人口密度、收入中位数)上常为最佳单一模型,与图像嵌入做多模态融合后优于单模态。树覆盖、海拔等环境任务仍有待改进。
Google 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项论文,分别评估 AI 乳腺癌筛查系统的独立性能及其作为第二读片人嵌入双读流程的效果。
推荐理由:两项研究给出了AI作为第二读片人的性能数据与部署细节,可供评估AI嵌入既有人工复核流程的可行性与难点。
Google 与康奈尔大学合作,用 67 道高温超导专家级问题评测 6 个 LLM,NotebookLM 和自建 RAG 系统表现最佳。被评测的还有 GPT-4o、Perplexity、Claude 3.5 和 Gemini Advanced Pro 1.5;NotebookLM 在视角平衡、全面性与证据支撑上得分最高,但最不简洁。论文发表于 PNAS,封闭系统使用 1,726 篇来源。
Google 推出 Groundsource,用 Gemini 从多语言新闻报道中抽取洪水事件,并开放首个城市山洪数据集,包含 260 万条记录、覆盖 150 多个国家、时间跨度从 2000 年至今。
Google Research 与 Beth Israel Deaconess Medical Center 合作,在真实门诊流程中开展 AMIE 对话式诊断 AI 的前瞻性单中心可行性研究,100 名成年患者就诊前通过安全网页链接与 AMIE 进行文本问诊,全程由医生视频监督,未触发任何安全中止。
推荐理由:研究以盲评方式对比 AMIE 与初级保健医生的鉴别诊断和管理计划质量,为对话式医疗 AI 的真实落地提供参照。
word2vec 的学习过程被证明在实际条件下可约简为无权重最小二乘矩阵分解,最终表示等价于 PCA。从接近零初始化训练时,它按离散步骤依次学习正交线性子空间,每步提升嵌入矩阵秩并阶梯式降低损失。这些特征可闭式算作矩阵 M* 的前几个特征向量,按 Wikipedia 统计前几项对应名人传记、政府市政与地理制图等概念。
Mistral AI 发布 LLM 全生命周期环境足迹研究,与 Carbone 4、法国生态转型署 ADEME 合作完成,并由 Resilio 和 Hubblo 复核。
推荐理由:Mistral 公布模型训练与推理的环境足迹核算口径及具体数据,可供评估 AI 环境影响时对照参考。
哈佛大学团队发布 Wake Vision 数据集,约 600 万张图像,规模约为 TinyML 人物检测数据集 VWW 的 100 倍。数据集分为侧重规模的 Large 与侧重标注质量的 Quality 两个训练集,精度较 VWW 最高提升 6.6%,人工标注验证下错误率从 7.8% 降至 2.2%。
Google Research 健康 AI 团队展示如何用 TensorFlow Lite 在手机上运行孕龄与胎位评估模型,让只接受几小时培训、没有超声背景的人员通过盲扫协议采集视频就能得到与标准诊疗相当的预测结果。