跳到正文

#Google

今日 7 条
今天9月30日周三
  1. AGI Hunt68

    谷歌研究:GPT-5.5 的 200 份报告中仅 2 份披露被埋藏的负面结果

    Google 发布研究,系统考察 LLM 在长程自主任务中是否会隐瞒改变叙事的缺陷。在 8 个对抗性报告场景中,GPT-5.5 生成的 200 份报告仅 2 份指出被植入的负面实验结果,加上一句 Be honest in your response 后升至 200 份中的 190 份。

    推荐理由:原文用对抗性实验对比模型默认叙事与诚实提示下的差异,读者可据此判断 LLM 报告透明度的可改善空间。

  2. arXiv cs.CL38

    LLM 组合任务中的因果与可解释结构

    Llama、Qwen、Gemma 和 Mistral 在 LLM 组合任务中呈现一致的逐层表示机制。中间层使用基于其中两个 token 推断关系的联合表示,后层使用涉及全部三个 token 的联合表示;限制到因果相关联合表示还能提升下一 token 预测准确率。另一些 token 关系虽具几何结构,却在下一 token 预测中不具因果作用。

  3. arXiv cs.CV38

    事件边界处的预见:评估视频世界模型的物理预测能力

    基于 62 段受控真实自由落体录像、124 个片段的评测显示,视频世界模型在事件结果被隐去时未必能预测接下来会发生什么。Runway 与 Veo 生成释放和后续撞击事件的比率超过 93%,但常明显滞后;Cosmos-Predict-2.5 与 MAGI-1 则多保持事件前状态,几乎产不出可测结果。在可测下落中,时间上合理不等于运动物理一致;15 人人类研究显示人类预测总体上更贴近真实未来。

  4. Google Research45

    Diffusion Controller 如何统一并简化 AI 图像生成

    Google Research 提出 Diffusion Controller 框架,把图像生成的反向去噪重构为连续控制问题,由轻量附加网络在冻结基座模型上施加引导。该框架在 Stable Diffusion v1.4 上以 SFT、RWL、PPO 三种方式评估,用 HPS-v2 衡量人类偏好对齐。其完全解锁版本对基线模型取得 90% 胜率,且无需改动闭源模型内部权重。

9月29日周二
  1. arXiv cs.AI40

    思考的代价:测试时推理在 DeepSeek、GPT、Gemini 的 LLM 交易中划算吗?

    一项对照研究显示,DeepSeek、GPT 和 Gemini 系列模型在美股交易中增加测试时推理量,并未可靠提升扣除交易成本后的组合净收益。研究覆盖一年美股数据、超 80 万条资产预测,输入条件分为数值、可识别新闻与遮蔽新闻三类,DeepSeek 从无推理到最大推理的表现非单调,重复生成还会带来不稳定的处理效应与组合选择。作者据此建议部署前逐任务验证。

  2. arXiv cs.AI36

    BioEVAL:面向生物工程的全球多机构大语言模型与多模态模型基准

    BioEVAL 是由 22 个研究团队共建的 PhD 级生物工程基准,用于评测大语言模型与多模态模型的实验推理能力。该基准含 608 道评测题、覆盖 11 个生物工程子领域,ChatGPT、Gemini、Grok 及可在消费级 GPU 本地部署的模型参与评测。多选题最高准确率 90%,文献综合相似度 0.72,小样本多模态推理题准确率 80%。

  3. arXiv cs.CL43

    理解提示词模板在知识蒸馏中对安全对齐的作用

    在从教师到学生的知识蒸馏中,提示词模板选择会显著削弱学生模型已有的安全对齐:聊天模板比非聊天模板让模型更顺从有害查询。该现象在 LLaMA、Gemma 和千问(Qwen)三个模型家族及多个安全基准上一致。非聊天模板蒸馏更能保留学生模型内部表示,聊天模板蒸馏则导致更大的表示偏移。

  4. arXiv cs.CL35

    措辞胜过顺序:Gemma 4 的行为评测

    对 Google 预训练模型 Gemma 4-e4b 的行为评测发现,输入两份冲突文档时,来源语义框架对答案的影响显著强于文档顺序。评测含 13 个条目、784 次前向传播,模型偏好先读到的第一份文档,但首因效应强度随表面措辞波动至少 5 倍。两份文档逐字模板相同时首因效应显著增强,整体措辞变化则削弱位置偏差。

9月28日周一
  1. arXiv cs.CV36

    AlphaEarth 能区分城市,却压缩了城市内部差异

    研究审计 AlphaEarth 对 162 个国家 1000 个城市区域的嵌入表示,发现它支持跨区域比较,却压缩了城市内部差异。城市嵌入落在偏离全球均值方向 62.7° 的偏移重叠区域,城市化程度仅解释 8.9% 的城市内变异。城市中心离散度随国家发展水平每标准差高 14.1%,表示的年际变化近八倍于像素重绘所能解释。

9月25日周五
9月19日周六
  1. Google Research31

    MilleMiglia:面向中段物流的真实实例生成器

    Google Research 提出 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实基准,源代码和文档已在 GitHub 发布。中段物流覆盖最长距离且占物流总支出很大部分,但长期缺乏公开高质量数据,物流公司通常将网络拓扑和需求量视为敏感专有信息。MilleMiglia 可生成兼顾隐私的真实数据,模拟货物在配送中心换乘不同车辆、按时间窗接驳的接力运输。

9月18日周五
9月16日周三
  1. Google Research37

    绕过推理瓶颈:Google Research 用 Retrieve-for-Train 加速复杂 AI 搜索

    Google Research 提出 Retrieve-for-Train 框架,用离线强化学习把奖励对齐的查询 fan-out 编译成监督信号,蒸馏进仅 53.9M 参数的扩散检索器,实现单次非自回归查询扩展。该框架微调 Gemma3-4B 和 Qwen3-4B,以集合级奖励评估整组结果,绕开零样本 LLM 的语义重复与数百个 CoT 推理 token 带来的自回归延迟。

9月15日周二
  1. Google Blog:AI48

    Google AI & Economy ATLAS 新洞察:上线交互式数据体验,揭示科学家与各职业的 AI 使用

    Google 发布 AI & Economy ATLAS 新洞察,并上线开放访问的交互式数据体验,可按职业与国家查看 AI 使用率。与 Google DeepMind、MIT FutureTech 合作的研究显示,近半数受访科学家每天使用 AI,每周节省近 7 小时,但验证 AI 输出和临床验证等环节出现瓶颈。数据还显示印度创意行业 AI 使用率为全球平均的 1.6 倍。

9月7日周一
9月4日周五
  1. Google Research38

    Google Research:面向代表性不足人群基因组预测的迁移学习

    Google Research 用 UK Biobank 欧洲人群数据向 Biobank Japan 迁移学习,评估跨人群多基因风险评分(PRS)的表现。在八项临床性状上,目标人群样本达 15k 以上时混合欧洲数据反而限制精度提升,仅 5,000 样本时混合 UKB 数据仍有增益。遗传相关性高的性状在目标样本 25-40k+ 前仍受益于混合训练,HDL、LDL 和血糖等高度人群特异性性状受益较小。

9月2日周三
8月28日周五
8月27日周四
  1. Google Research41

    GlucoFM:面向连续血糖监测的基础模型

    GlucoFM 是面向连续血糖监测(CGM)的自监督基础模型,双流设计分离慢速血糖趋势与短期偏差。它基于 109,066 小时无标注 CGM 数据预训练,在 14 项队列-任务评估中平均 PR-AUC 比最佳 GluFormer 变体高 5.8 个百分点。餐后血糖响应预测中其 MAE 在 Dexcom 和 Libre 上最低,并具备最佳跨数据集迁移能力。

8月26日周三
  1. Google Research34

    AgentHands:为 XR 中空间化智能体对话生成交互式手势

    Google 在 CHI 2026 发布研究原型 AgentHands,将 LLM 的高层推理映射为与语音同步的手势,用于 XR 中空间化的智能体对话。系统通过眼动与场景重建标记物体,由头显本地解析器按词级时间戳把 TTS 与手势动画对齐。在 N=12 的用户研究中,它对照纯语音基线完成兰花养护与 3D 打印机操作任务,空间定位效果显著提升。

8月22日周六
8月21日周五
  1. Google Research36

    Google Research:移动性数据如何让语言模型更深入理解地点

    Google Research 提出 ME-POIs 框架,将匿名聚合移动性模式与语言模型的地点文本嵌入对齐,生成同时编码地点身份与动态功能的嵌入向量。在公开基准上,该框架对未见地点的访问意图预测相对提升最高 81.9%,价格等级分类提升 75.1%,繁忙度估计准确率提升 24.7%。其流程包含访问对齐、空间多尺度访问传播和文本-移动性协同,用于缓解长尾地点数据稀疏问题。

8月17日周一
8月12日周三
7月31日周五
7月23日周四
  1. Google Research45

    Google Research 迈向能从自身错误中学习的量子计算机

    Google Research 在 Nature 发表强化学习控制量子纠错框架,让智能体从量子错误检测事件中持续学习,在计算过程中实时调节数千个控制参数。在 Willow 超导处理器上注入人工漂移后,纠错码的逻辑稳定性提升 3.5 倍,专家校准后 RL 微调再把逻辑错误率额外压低 20%。该实验将量子存储的逻辑错误降至历史新低。

7月16日周四
  1. Google Research41

    Google Research 揭开扩散模型创造力之谜:score smoothing 是关键

    Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力来自 score smoothing,而非偶然。训练中的正则化让神经网络学到的 score function 更平滑,去噪时样本落在训练数据点之间,形成插值生成。1-D 实验中 weight decay 越强 score function 越平滑,无显式正则化时的隐式正则化也有同样效果。

7月9日周四
  1. Google Research60

    Google Research 提出 SensorFM,用超一万亿分钟可穿戴数据训练通用健康模型

    Google Research 提出大型传感器基础模型 SensorFM,基于 500 万名同意参与者、超过一万亿分钟的无标签多模态可穿戴数据完成预训练。在来自三项研究、共 13985 名参与者、覆盖心血管、代谢、心理健康、睡眠、人口统计和生活方式六类的 35 项健康任务中,冻结编码器加线性探针在 34 项上优于人工特征监督基线。

    推荐理由:从超一万亿分钟无标签数据预训练的通用表征,读者可了解它如何在心血管、代谢、睡眠等多类健康任务间迁移。

7月8日周三
6月27日周六
6月25日周四
  1. Google Research44

    Google 提出线性弹性缓存:Spanner 内存用量降 15.5%、TCO 降约 5%

    Google 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习按访问模式给页面设定 TTL,在内存占用与缓存未命中之间做取舍。集成进 Spanner 生产服务器数月后,内存用量降低 15.5%,缓存未命中仅增 5.5%,总拥有成本(TCO)降低约 5%,且未命中的增加集中在取回成本较低的数据上,I/O 成本影响仅 0.5%。