跳到正文

#论文/研究

今日 2 条
7月23日周四
  1. Google Research45

    Google Research 迈向能从自身错误中学习的量子计算机

    Google Research 在 Nature 发表强化学习控制量子纠错框架,让智能体从量子错误检测事件中持续学习,在计算过程中实时调节数千个控制参数。在 Willow 超导处理器上注入人工漂移后,纠错码的逻辑稳定性提升 3.5 倍,专家校准后 RL 微调再把逻辑错误率额外压低 20%。该实验将量子存储的逻辑错误降至历史新低。

7月16日周四
  1. Google Research41

    Google Research 揭开扩散模型创造力之谜:score smoothing 是关键

    Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力来自 score smoothing,而非偶然。训练中的正则化让神经网络学到的 score function 更平滑,去噪时样本落在训练数据点之间,形成插值生成。1-D 实验中 weight decay 越强 score function 越平滑,无显式正则化时的隐式正则化也有同样效果。

7月15日周三
  1. HuggingFace Blog56

    Hume 推出语音 AI 人类质量评测基准 Real World VoiceEQ

    Hume 推出 Real World VoiceEQ 基准,用于评估语音 AI 交互的人类质量,覆盖 40 多款闭源与开源语音模型、15 个以上评测维度和 60 多项指标。该基准基于超 100 万条人工评分构建,含 78.5 万条 TTS 评分与 4.8 万条 STS 评分。评测显示语音模型的说话能力普遍强于聆听能力,没有一种配置在全部八类能力上进入前五,传统基准会高估真实场景表现。

7月9日周四
  1. Google Research60

    Google Research 提出 SensorFM,用超一万亿分钟可穿戴数据训练通用健康模型

    Google Research 提出大型传感器基础模型 SensorFM,基于 500 万名同意参与者、超过一万亿分钟的无标签多模态可穿戴数据完成预训练。在来自三项研究、共 13985 名参与者、覆盖心血管、代谢、心理健康、睡眠、人口统计和生活方式六类的 35 项健康任务中,冻结编码器加线性探针在 34 项上优于人工特征监督基线。

    推荐理由:从超一万亿分钟无标签数据预训练的通用表征,读者可了解它如何在心血管、代谢、睡眠等多类健康任务间迁移。

7月8日周三
6月30日周二
  1. HuggingFace Blog38

    DiScoFormer:一个 Transformer 跨分布同时估计密度与得分

    DiScoFormer(Density and Score Transformer)用一个 Transformer 在单次前向传播中同时估计数据分布的密度与得分,无需针对新分布重新训练。在 100 维下对比最优手工调参的 KDE,其得分误差降低约 6.5 倍、密度误差降低逾 37 倍。模型以高斯混合模型训练,共享主干配密度与得分双输出头,并可在推理时用一致性损失适配分布外输入。

6月27日周六
6月25日周四
  1. Google Research44

    Google 提出线性弹性缓存:Spanner 内存用量降 15.5%、TCO 降约 5%

    Google 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习按访问模式给页面设定 TTL,在内存占用与缓存未命中之间做取舍。集成进 Spanner 生产服务器数月后,内存用量降低 15.5%,缓存未命中仅增 5.5%,总拥有成本(TCO)降低约 5%,且未命中的增加集中在取回成本较低的数据上,I/O 成本影响仅 0.5%。

6月17日周三
  1. Google Research40

    从像素到规划:Google Earth AI 用于自然修复

    Google Earth AI 将 Farmscapes 2020 的英格兰高分辨率地图转为矢量化生态数据集,把树篱、石墙和小树林等标准卫星难以探测的细尺度特征变成可用于景观修复与碳核算的清单。模型以 RSF 在超 3 亿张全球卫星影像上预训练的 ViT 为骨干,仅用约 247 km² 标注数据微调,并用 Polsby–Popper 紧凑度分数区分细长树篱与成片林地。

6月16日周二
6月13日周六
6月11日周四
6月8日周一
  1. Google DeepMind65

    Google DeepMind 公布塞拉利昂 Guided Learning 教学试验结果

    Google DeepMind 公布在塞拉利昂开展的 Guided Learning 预先注册随机对照试验结果,使用该工具的学生数学成绩比对照组高 0.258 个标准差,相当于八周内取得约 1.2 至 1.7 年的常规学习进展。

    推荐理由:原研究给出随机对照试验的量化结果,可据此了解 AI 引导式学习在课堂中的实际增益与局限。

6月5日周五
  1. Google Research62

    Google 提出 PHRM 系统,用手机前置摄像头被动监测心率与静息心率

    Google Research 在 Nature 发表研究,提出 PHRM 系统,可在日常使用手机时后台监测心率(HR)与静息心率(RHR)。该系统利用前置摄像头在面部解锁后的数秒内拍摄视频,通过端侧深度学习估计心率,与 ECG 相比 MAPE 低于 10%,符合所有肤色人群的行业精度标准,日 RHR 与 Fitbit Charge 6 相比 MAE 为 4.39 bpm。

    推荐理由:论文公开了 PHRM 的跨肤色误差数据与大样本数据集规模,读者可对照可穿戴设备理解被动健康监测的量化标准。

5月28日周四
5月20日周三
  1. Google Research60

    Google 发表 ERA 的 Nature 论文,并逐步开放由 ERA 与 AlphaEvolve 构建的 Computational Discovery

    Google 在 Nature 发表论文介绍 ERA,这是用 Gemini 为科学家编写和优化科学代码的研究工具,在基因组学、公共卫生、卫星图像分析、神经科学预测、通用时间序列预测和数学等基准上达到专家级表现。

    推荐理由:ERA 在基因组学、公共卫生等多个基准上达到专家级表现,正文另列出八项已发表的跨学科科研应用。

5月16日周六
5月12日周二
4月30日周四
  1. Google DeepMind63

    Google DeepMind 发布 AI co-clinician 医疗研究计划

    Google DeepMind 发布 AI co-clinician 医疗研究计划,探索在医生监督下由 AI 智能体参与患者问诊的三元照护模式。研究在 98 条真实初级保健查询中有 97 条无关键错误,并在 140 项问诊技能评估中于 68 项达到或超过初级保健医生水平,专家医生整体表现仍更好。

    推荐理由:文章以 140 项问诊技能的盲评对比,呈现 AI co-clinician 与初级保健医生的能力差异和仍待改进之处。

4月22日周三
  1. Google Research49

    ReasoningBank:让智能体从经验中学习

    Google Research 提出的 ReasoningBank 让智能体从成功与失败经验中提炼高层推理模式,实现测试时自我演化。在 Gemini-2.5-Flash 上,WebArena 成功率比无记忆基线高 8.3%,SWE-Bench-Verified 高 4.6%,每任务少用近 3 个执行步骤。配套的 MaTTS 通过并行与串行扩展,把探索轨迹也转化为高质量记忆。

4月16日周四
  1. Google Research46

    Google Research 提出 MoGen:用 AI 合成神经元加速大脑图谱绘制

    Google Research 用合成神经元形状增强 PATHFINDER 训练数据,将小鼠轴突重建误差降低 4.4%。其 MoGen 模型基于 PointInfinity 点云流匹配,用 1,795 个小鼠皮层轴突训练,训练数据加入 10% 合成形状即可减少合并错误。MoGen 已开源,论文将在 ICLR 2026 发表;按完整小鼠脑规模计算,相当于节省 157 人年人工校对。

4月9日周四
4月3日周五
  1. Google Research46

    Google Research 评估 LLM 行为倾向与人类的对齐程度

    Google Research 提出基于情境判断测试(SJT)的框架,评估 25 个 LLM 的行为倾向与人类共识的对齐程度。结果显示两类差距:模型倾向会偏离人类标注共识,且在人类无共识时无法覆盖其意见分布。人类标注一致时大规模与前沿闭源模型接近满分,共识低于 90% 时停滞在 80% 出头。

4月1日周三
  1. Google Research45

    Google Research:构建更好的 AI 基准,多少名标注者才够?

    Google Research 的“Forest vs Tree”研究指出,AI 评测常用的每项 1–5 名标注者标准不足,往往需要超过 10 名标注者。基于 Toxicity 等数据集的模拟显示,最优配比取决于指标:多数投票准确率偏向增加条目,捕捉意见分布则需增加标注者;约 1,000 条总标注即可实现高可复现性,模拟器已在 GitHub 开源。

3月25日周三
  1. Google Research42

    Google Research 的 S2Vec 如何学习城市语言,映射现代世界

    Google Research 提出自监督框架 S2Vec,用 S2 Geometry 分区加特征栅格化把建成环境转为多层图像,再以掩码自编码(MAE)学习通用嵌入向量。在社会经济预测中,S2Vec 在零样本地理外推任务(如 US-wide 人口密度、收入中位数)上常为最佳单一模型,与图像嵌入做多模态融合后优于单模态。树覆盖、海拔等环境任务仍有待改进。

3月18日周三
  1. Google Research72

    Google 与 NHS 合作在 Nature Cancer 发表两项 AI 乳腺癌筛查研究

    Google 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项论文,分别评估 AI 乳腺癌筛查系统的独立性能及其作为第二读片人嵌入双读流程的效果。

    推荐理由:两项研究给出了AI作为第二读片人的性能数据与部署细节,可供评估AI嵌入既有人工复核流程的可行性与难点。

3月17日周二
3月12日周四
  1. Google Research65

    Google Research 与 BIDMC 开展 AMIE 对话式诊断 AI 真实临床可行性研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作,在真实门诊流程中开展 AMIE 对话式诊断 AI 的前瞻性单中心可行性研究,100 名成年患者就诊前通过安全网页链接与 AMIE 进行文本问诊,全程由医生视频监督,未触发任何安全中止。

    推荐理由:研究以盲评方式对比 AMIE 与初级保健医生的鉴别诊断和管理计划质量,为对话式医疗 AI 的真实落地提供参照。

7月23日周三
12月6日周五
6月21日周三