ReasoningBank:让智能体从经验中学习
Google Research 提出的 ReasoningBank 让智能体从成功与失败经验中提炼高层推理模式,实现测试时自我演化。在 Gemini-2.5-Flash 上,WebArena 成功率比无记忆基线高 8.3%,SWE-Bench-Verified 高 4.6%,每任务少用近 3 个执行步骤。配套的 MaTTS 通过并行与串行扩展,把探索轨迹也转化为高质量记忆。
Google Research 提出的 ReasoningBank 让智能体从成功与失败经验中提炼高层推理模式,实现测试时自我演化。在 Gemini-2.5-Flash 上,WebArena 成功率比无记忆基线高 8.3%,SWE-Bench-Verified 高 4.6%,每任务少用近 3 个执行步骤。配套的 MaTTS 通过并行与串行扩展,把探索轨迹也转化为高质量记忆。
Google Research 提出推理优先的合成数据框架 Simula,不依赖种子数据,可从第一性原理构建完整数据集。该框架用全局多样化、局部多样化、复杂化与双 critic 质量校验四步控制生成。
Google Research 用合成神经元形状增强 PATHFINDER 训练数据,将小鼠轴突重建误差降低 4.4%。其 MoGen 模型基于 PointInfinity 点云流匹配,用 1,795 个小鼠皮层轴突训练,训练数据加入 10% 合成形状即可减少合并错误。MoGen 已开源,论文将在 ICLR 2026 发表;按完整小鼠脑规模计算,相当于节省 157 人年人工校对。
Google Research 提出 ConvApparel 数据集,用 4000+ 段、近 15000 轮服装购物人机对话量化并弥合 LLM 用户模拟器的真实感差距。
Google Research 提出基于情境判断测试(SJT)的框架,评估 25 个 LLM 的行为倾向与人类共识的对齐程度。结果显示两类差距:模型倾向会偏离人类标注共识,且在人类无共识时无法覆盖其意见分布。人类标注一致时大规模与前沿闭源模型接近满分,共识低于 90% 时停滞在 80% 出头。
Google Research 的“Forest vs Tree”研究指出,AI 评测常用的每项 1–5 名标注者标准不足,往往需要超过 10 名标注者。基于 Toxicity 等数据集的模拟显示,最优配比取决于指标:多数投票准确率偏向增加条目,捕捉意见分布则需增加标注者;约 1,000 条总标注即可实现高可复现性,模拟器已在 GitHub 开源。
Google 推出 TurboQuant,一种零精度损失的压缩算法,可同时压缩 KV cache 并加速向量搜索。它先用 PolarQuant 随机旋转向量完成主体压缩,再用 1 bit 的 QJL 消除残差误差,TurboQuant 将在 ICLR 2026 展示。
Google Research 提出自监督框架 S2Vec,用 S2 Geometry 分区加特征栅格化把建成环境转为多层图像,再以掩码自编码(MAE)学习通用嵌入向量。在社会经济预测中,S2Vec 在零样本地理外推任务(如 US-wide 人口密度、收入中位数)上常为最佳单一模型,与图像嵌入做多模态融合后优于单模态。树覆盖、海拔等环境任务仍有待改进。
Google 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项论文,分别评估 AI 乳腺癌筛查系统的独立性能及其作为第二读片人嵌入双读流程的效果。
推荐理由:两项研究给出了AI作为第二读片人的性能数据与部署细节,可供评估AI嵌入既有人工复核流程的可行性与难点。
Google 与康奈尔大学合作,用 67 道高温超导专家级问题评测 6 个 LLM,NotebookLM 和自建 RAG 系统表现最佳。被评测的还有 GPT-4o、Perplexity、Claude 3.5 和 Gemini Advanced Pro 1.5;NotebookLM 在视角平衡、全面性与证据支撑上得分最高,但最不简洁。论文发表于 PNAS,封闭系统使用 1,726 篇来源。
Google Research 与 Beth Israel Deaconess Medical Center 合作,在真实门诊流程中开展 AMIE 对话式诊断 AI 的前瞻性单中心可行性研究,100 名成年患者就诊前通过安全网页链接与 AMIE 进行文本问诊,全程由医生视频监督,未触发任何安全中止。
推荐理由:研究以盲评方式对比 AMIE 与初级保健医生的鉴别诊断和管理计划质量,为对话式医疗 AI 的真实落地提供参照。
Google Research 发布 WAXAL 开放语音数据集,覆盖 27 种撒哈拉以南非洲语言,面向超 1 亿使用者,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时转写自然语音的 ASR 数据和超 565 小时高保真录音的 TTS 数据。采集工作自 2021 年起由非洲高校与社区组织主导、Google 提供方法指导,Google 表示将继续扩充语种。
word2vec 的学习过程被证明在实际条件下可约简为无权重最小二乘矩阵分解,最终表示等价于 PCA。从接近零初始化训练时,它按离散步骤依次学习正交线性子空间,每步提升嵌入矩阵秩并阶梯式降低损失。这些特征可闭式算作矩阵 M* 的前几个特征向量,按 Wikipedia 统计前几项对应名人传记、政府市政与地理制图等概念。
哈佛大学团队发布 Wake Vision 数据集,约 600 万张图像,规模约为 TinyML 人物检测数据集 VWW 的 100 倍。数据集分为侧重规模的 Large 与侧重标注质量的 Quality 两个训练集,精度较 VWW 最高提升 6.6%,人工标注验证下错误率从 7.8% 降至 2.2%。