跳到正文

全部动态

今日 230 条
9月15日周二
  1. Google Blog:AI48

    Google AI & Economy ATLAS 新洞察:上线交互式数据体验,揭示科学家与各职业的 AI 使用

    Google 发布 AI & Economy ATLAS 新洞察,并上线开放访问的交互式数据体验,可按职业与国家查看 AI 使用率。与 Google DeepMind、MIT FutureTech 合作的研究显示,近半数受访科学家每天使用 AI,每周节省近 7 小时,但验证 AI 输出和临床验证等环节出现瓶颈。数据还显示印度创意行业 AI 使用率为全球平均的 1.6 倍。

9月9日周三
9月8日周二
  1. OpenAI:官网动态87

    OpenAI 分享 AI 生成的纳维-斯托克斯千禧年难题解答与 Lean 形式化证明

    OpenAI 表示正在分享一份由 AI 生成的纳维-斯托克斯千禧年难题解答,包含一份说明文档和一份 Lean 形式化证明。该条目目前只有这一句简要描述,未提供更多细节。

    推荐理由:AI 生成的纳维-斯托克斯千禧年难题解答以 Lean 形式化证明一并公开,读者可关注机器产出数学证明的呈现方式。

9月7日周一
9月4日周五
  1. Google Research38

    Google Research:面向代表性不足人群基因组预测的迁移学习

    Google Research 用 UK Biobank 欧洲人群数据向 Biobank Japan 迁移学习,评估跨人群多基因风险评分(PRS)的表现。在八项临床性状上,目标人群样本达 15k 以上时混合欧洲数据反而限制精度提升,仅 5,000 样本时混合 UKB 数据仍有增益。遗传相关性高的性状在目标样本 25-40k+ 前仍受益于混合训练,HDL、LDL 和血糖等高度人群特异性性状受益较小。

9月2日周三
  1. HuggingFace Blog46

    BenchMIRT:LLM 基准测试究竟在测什么?

    BenchMIRT 是一种在单条 prompt 层面审计 LLM 基准测试的新方法,基于多维 IRT。它用 100 个 LLM、16 个 benchmark、超 34K 道题的结果训练,未被告知各 benchmark 测什么,却独立恢复出安全与通用推理两大维度。分析还发现 BBQ、WMDP 的得分更贴近通用推理而非安全。

8月28日周五
8月27日周四
  1. Google Research41

    GlucoFM:面向连续血糖监测的基础模型

    GlucoFM 是面向连续血糖监测(CGM)的自监督基础模型,双流设计分离慢速血糖趋势与短期偏差。它基于 109,066 小时无标注 CGM 数据预训练,在 14 项队列-任务评估中平均 PR-AUC 比最佳 GluFormer 变体高 5.8 个百分点。餐后血糖响应预测中其 MAE 在 Dexcom 和 Libre 上最低,并具备最佳跨数据集迁移能力。

8月26日周三
  1. Google Research34

    AgentHands:为 XR 中空间化智能体对话生成交互式手势

    Google 在 CHI 2026 发布研究原型 AgentHands,将 LLM 的高层推理映射为与语音同步的手势,用于 XR 中空间化的智能体对话。系统通过眼动与场景重建标记物体,由头显本地解析器按词级时间戳把 TTS 与手势动画对齐。在 N=12 的用户研究中,它对照纯语音基线完成兰花养护与 3D 打印机操作任务,空间定位效果显著提升。

8月25日周二
8月22日周六
8月21日周五
  1. Google Research36

    Google Research:移动性数据如何让语言模型更深入理解地点

    Google Research 提出 ME-POIs 框架,将匿名聚合移动性模式与语言模型的地点文本嵌入对齐,生成同时编码地点身份与动态功能的嵌入向量。在公开基准上,该框架对未见地点的访问意图预测相对提升最高 81.9%,价格等级分类提升 75.1%,繁忙度估计准确率提升 24.7%。其流程包含访问对齐、空间多尺度访问传播和文本-移动性协同,用于缓解长尾地点数据稀疏问题。

  2. HuggingFace Blog62

    Hugging Face 用三种方法检测语音识别基准过拟合,11 个开源 ASR 模型被检出复现错误参考文本

    Hugging Face 发布研究,用三种探测方法量化语音识别中的基准优化现象,评测 11 个开源 ASR 模型后发现部分高分模型会复现 VoxPopuli、LibriSpeech 参考文本里的错误内容,即使音频与之矛盾。

    推荐理由:原文用三种探测方法量化 ASR 模型对公开基准的过拟合,并给出开源脚本与榜单入口,可作为自查评测可信度的参考。

8月19日周三
8月17日周一
8月13日周四
8月12日周三
8月11日周二
8月10日周一
7月31日周五
  1. Microsoft Research55

    微软 Echoverse:面向 computer-use 智能体的深度演进训练环境

    微软研究院发布 Echoverse,为 computer-use 智能体构建十二个高保真合成训练环境,任务结果由数据库真值而非截屏评分。在其上训练的 9B 模型在十四个域上平均分从 36.5% 提升到 67.1%,与 GPT-5.4 的 80.7% 相差十四分;用同一批环境做强化学习,五个世界留出集的评委分从 58% 升到 69%。

7月27日周一
7月23日周四
  1. Google Research45

    Google Research 迈向能从自身错误中学习的量子计算机

    Google Research 在 Nature 发表强化学习控制量子纠错框架,让智能体从量子错误检测事件中持续学习,在计算过程中实时调节数千个控制参数。在 Willow 超导处理器上注入人工漂移后,纠错码的逻辑稳定性提升 3.5 倍,专家校准后 RL 微调再把逻辑错误率额外压低 20%。该实验将量子存储的逻辑错误降至历史新低。

7月16日周四
  1. Google Research41

    Google Research 揭开扩散模型创造力之谜:score smoothing 是关键

    Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力来自 score smoothing,而非偶然。训练中的正则化让神经网络学到的 score function 更平滑,去噪时样本落在训练数据点之间,形成插值生成。1-D 实验中 weight decay 越强 score function 越平滑,无显式正则化时的隐式正则化也有同样效果。

7月15日周三
  1. HuggingFace Blog56

    Hume 推出语音 AI 人类质量评测基准 Real World VoiceEQ

    Hume 推出 Real World VoiceEQ 基准,用于评估语音 AI 交互的人类质量,覆盖 40 多款闭源与开源语音模型、15 个以上评测维度和 60 多项指标。该基准基于超 100 万条人工评分构建,含 78.5 万条 TTS 评分与 4.8 万条 STS 评分。评测显示语音模型的说话能力普遍强于聆听能力,没有一种配置在全部八类能力上进入前五,传统基准会高估真实场景表现。

7月9日周四
  1. Google Research60

    Google Research 提出 SensorFM,用超一万亿分钟可穿戴数据训练通用健康模型

    Google Research 提出大型传感器基础模型 SensorFM,基于 500 万名同意参与者、超过一万亿分钟的无标签多模态可穿戴数据完成预训练。在来自三项研究、共 13985 名参与者、覆盖心血管、代谢、心理健康、睡眠、人口统计和生活方式六类的 35 项健康任务中,冻结编码器加线性探针在 34 项上优于人工特征监督基线。

    推荐理由:从超一万亿分钟无标签数据预训练的通用表征,读者可了解它如何在心血管、代谢、睡眠等多类健康任务间迁移。

7月8日周三
7月1日周三
6月30日周二
  1. HuggingFace Blog38

    DiScoFormer:一个 Transformer 跨分布同时估计密度与得分

    DiScoFormer(Density and Score Transformer)用一个 Transformer 在单次前向传播中同时估计数据分布的密度与得分,无需针对新分布重新训练。在 100 维下对比最优手工调参的 KDE,其得分误差降低约 6.5 倍、密度误差降低逾 37 倍。模型以高斯混合模型训练,共享主干配密度与得分双输出头,并可在推理时用一致性损失适配分布外输入。

6月27日周六
6月25日周四
  1. Google Research44

    Google 提出线性弹性缓存:Spanner 内存用量降 15.5%、TCO 降约 5%

    Google 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习按访问模式给页面设定 TTL,在内存占用与缓存未命中之间做取舍。集成进 Spanner 生产服务器数月后,内存用量降低 15.5%,缓存未命中仅增 5.5%,总拥有成本(TCO)降低约 5%,且未命中的增加集中在取回成本较低的数据上,I/O 成本影响仅 0.5%。

6月22日周一
6月17日周三
  1. Google Research40

    从像素到规划:Google Earth AI 用于自然修复

    Google Earth AI 将 Farmscapes 2020 的英格兰高分辨率地图转为矢量化生态数据集,把树篱、石墙和小树林等标准卫星难以探测的细尺度特征变成可用于景观修复与碳核算的清单。模型以 RSF 在超 3 亿张全球卫星影像上预训练的 ViT 为骨干,仅用约 247 km² 标注数据微调,并用 Polsby–Popper 紧凑度分数区分细长树篱与成片林地。

6月16日周二