跳到正文

#论文/研究

今日 2 条
今天9月30日周三
  1. Google Research45

    Diffusion Controller 如何统一并简化 AI 图像生成

    Google Research 提出 Diffusion Controller 框架,把图像生成的反向去噪重构为连续控制问题,由轻量附加网络在冻结基座模型上施加引导。该框架在 Stable Diffusion v1.4 上以 SFT、RWL、PPO 三种方式评估,用 HPS-v2 衡量人类偏好对齐。其完全解锁版本对基线模型取得 90% 胜率,且无需改动闭源模型内部权重。

9月29日周二
  1. Apple Machine Learning Research39

    语言模型树结构表达式序列化的通信瓶颈:一项往返研究

    研究用往返协议测试 16 个语言模型,发现用自然语言序列化树结构表达式存在有损且不对称的瓶颈,最佳生成-抽取组合准确率 92.9%。交换生成端与抽取端会使准确率变化最多 60.4 个百分点,至少 73.6% 的失败源自生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开放权重模型超过未训练的 Gemini-3.1-Pro。

  2. HuggingFace Blog45

    ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证

    ProvenanceGuard 是面向 MCP 智能体的来源感知事实核查层,在不重训模型的前提下对黑盒智能体答案做后置验证,专门识别事实为真但归错来源的跨源混淆。在 281 条医疗智能体真实轨迹中,专家判定 361 条断言里 139 条不应通过,该方法拦下 138 条,可识别来源时约 86% 选对来源。

9月25日周五
9月23日周三
9月19日周六
  1. Google Research31

    MilleMiglia:面向中段物流的真实实例生成器

    Google Research 提出 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实基准,源代码和文档已在 GitHub 发布。中段物流覆盖最长距离且占物流总支出很大部分,但长期缺乏公开高质量数据,物流公司通常将网络拓扑和需求量视为敏感专有信息。MilleMiglia 可生成兼顾隐私的真实数据,模拟货物在配送中心换乘不同车辆、按时间窗接驳的接力运输。

9月18日周五
9月17日周四
  1. Apple Machine Learning Research38

    REVERSAL-BENCH:衡量无重置强化学习悬崖的可逆性轴与重置 Oracle

    REVERSAL-BENCH 用连续参数 ρ∈[0,1] 控制可逆性并提供重置 Oracle,覆盖 5 个物理引擎的 8 种操作任务。评估多种策略架构后发现可逆性悬崖:ρ 升高时无重置智能体被永久吸入不可恢复状态,而有回合重置的智能体仍稳定学习。该基准套件、带可恢复性标注的多模拟器数据集与重置 Oracle 已发布,另测试了在不可逆失败前介入的安全护盾。

  2. OpenAI:官网动态53

    OpenAI 公布模型失准追踪与披露框架

    OpenAI 公布了一套用于追踪、调查和披露模型失准的框架,同时给出六份关于模型意外或令人担忧行为的报告。该框架面向模型失准的记录、调查与对外披露三个环节,正文细节尚未随摘要一并提供。

9月16日周三
  1. Apple Machine Learning Research46

    TS-DFM:以轨迹为教师、经能量导航蒸馏的少步离散流匹配

    TS-DFM 用能量导航替代离散流匹配训练中的盲随机跳步:轻量能量罗盘在每个中间点评估候选续写、选出最连贯的一支,且塑造仅在训练期进行,推理成本不变。在 170M 参数语言建模上,8 步学生模型的困惑度比 1024 步教师低 32%、速度快 128×,增益在多种源分布和三种规模递增的评估器上一致。其困惑度优于所有对比的离散生成基线,包括训练数据多 6× 或模型大 5× 的方法。

  2. Apple Machine Learning Research43

    面向智能体 LLM 系统的共享选择性持久记忆架构

    共享选择性持久记忆架构面向智能体 LLM 系统,只保留任务规范、数据 schema、工具配置与输出约束四类可复用上下文,工作区可按角色访问权限跨用户共享。在三个企业部署场景中任务完成率达 96%,高于无记忆的 79% 与保留完整历史的 71%。零 token 数据刷新免去重复更新的 LLM 重调用,任务耗时降低 14×;摘要驱动生成使单次调用 token 成本降低 97×。

  3. Google Research37

    绕过推理瓶颈:Google Research 用 Retrieve-for-Train 加速复杂 AI 搜索

    Google Research 提出 Retrieve-for-Train 框架,用离线强化学习把奖励对齐的查询 fan-out 编译成监督信号,蒸馏进仅 53.9M 参数的扩散检索器,实现单次非自回归查询扩展。该框架微调 Gemma3-4B 和 Qwen3-4B,以集合级奖励评估整组结果,绕开零样本 LLM 的语义重复与数百个 CoT 推理 token 带来的自回归延迟。

9月15日周二
  1. Google Blog:AI48

    Google AI & Economy ATLAS 新洞察:上线交互式数据体验,揭示科学家与各职业的 AI 使用

    Google 发布 AI & Economy ATLAS 新洞察,并上线开放访问的交互式数据体验,可按职业与国家查看 AI 使用率。与 Google DeepMind、MIT FutureTech 合作的研究显示,近半数受访科学家每天使用 AI,每周节省近 7 小时,但验证 AI 输出和临床验证等环节出现瓶颈。数据还显示印度创意行业 AI 使用率为全球平均的 1.6 倍。

9月8日周二
  1. OpenAI:官网动态87

    OpenAI 分享 AI 生成的纳维-斯托克斯千禧年难题解答与 Lean 形式化证明

    OpenAI 表示正在分享一份由 AI 生成的纳维-斯托克斯千禧年难题解答,包含一份说明文档和一份 Lean 形式化证明。该条目目前只有这一句简要描述,未提供更多细节。

    推荐理由:AI 生成的纳维-斯托克斯千禧年难题解答以 Lean 形式化证明一并公开,读者可关注机器产出数学证明的呈现方式。

9月4日周五
  1. Google Research38

    Google Research:面向代表性不足人群基因组预测的迁移学习

    Google Research 用 UK Biobank 欧洲人群数据向 Biobank Japan 迁移学习,评估跨人群多基因风险评分(PRS)的表现。在八项临床性状上,目标人群样本达 15k 以上时混合欧洲数据反而限制精度提升,仅 5,000 样本时混合 UKB 数据仍有增益。遗传相关性高的性状在目标样本 25-40k+ 前仍受益于混合训练,HDL、LDL 和血糖等高度人群特异性性状受益较小。

9月2日周三
  1. HuggingFace Blog46

    BenchMIRT:LLM 基准测试究竟在测什么?

    BenchMIRT 是一种在单条 prompt 层面审计 LLM 基准测试的新方法,基于多维 IRT。它用 100 个 LLM、16 个 benchmark、超 34K 道题的结果训练,未被告知各 benchmark 测什么,却独立恢复出安全与通用推理两大维度。分析还发现 BBQ、WMDP 的得分更贴近通用推理而非安全。

8月28日周五
8月27日周四
  1. Google Research41

    GlucoFM:面向连续血糖监测的基础模型

    GlucoFM 是面向连续血糖监测(CGM)的自监督基础模型,双流设计分离慢速血糖趋势与短期偏差。它基于 109,066 小时无标注 CGM 数据预训练,在 14 项队列-任务评估中平均 PR-AUC 比最佳 GluFormer 变体高 5.8 个百分点。餐后血糖响应预测中其 MAE 在 Dexcom 和 Libre 上最低,并具备最佳跨数据集迁移能力。

8月26日周三
  1. Google Research34

    AgentHands:为 XR 中空间化智能体对话生成交互式手势

    Google 在 CHI 2026 发布研究原型 AgentHands,将 LLM 的高层推理映射为与语音同步的手势,用于 XR 中空间化的智能体对话。系统通过眼动与场景重建标记物体,由头显本地解析器按词级时间戳把 TTS 与手势动画对齐。在 N=12 的用户研究中,它对照纯语音基线完成兰花养护与 3D 打印机操作任务,空间定位效果显著提升。

8月25日周二
8月22日周六
8月21日周五
  1. Google Research36

    Google Research:移动性数据如何让语言模型更深入理解地点

    Google Research 提出 ME-POIs 框架,将匿名聚合移动性模式与语言模型的地点文本嵌入对齐,生成同时编码地点身份与动态功能的嵌入向量。在公开基准上,该框架对未见地点的访问意图预测相对提升最高 81.9%,价格等级分类提升 75.1%,繁忙度估计准确率提升 24.7%。其流程包含访问对齐、空间多尺度访问传播和文本-移动性协同,用于缓解长尾地点数据稀疏问题。

  2. HuggingFace Blog62

    Hugging Face 用三种方法检测语音识别基准过拟合,11 个开源 ASR 模型被检出复现错误参考文本

    Hugging Face 发布研究,用三种探测方法量化语音识别中的基准优化现象,评测 11 个开源 ASR 模型后发现部分高分模型会复现 VoxPopuli、LibriSpeech 参考文本里的错误内容,即使音频与之矛盾。

    推荐理由:原文用三种探测方法量化 ASR 模型对公开基准的过拟合,并给出开源脚本与榜单入口,可作为自查评测可信度的参考。

8月19日周三
8月17日周一
8月12日周三
8月11日周二
8月10日周一
8月6日周四
  1. Meta Engineering52

    Meta 公布广告排序多阶段序列建模架构与 LLM 式扩展规律

    Meta 公布广告排序的多阶段序列建模架构,把离线用户建模与在线排序解耦,并在真实广告流量上呈现出随算力对数线性增长的 LLM 式扩展规律。该架构用稠密 tokenization 与 target-aware 多头注意力融合稀疏特征和用户行为序列,让模型直接从数据学习特征交互,减少对手工特征的依赖。

7月31日周五
  1. Microsoft Research55

    微软 Echoverse:面向 computer-use 智能体的深度演进训练环境

    微软研究院发布 Echoverse,为 computer-use 智能体构建十二个高保真合成训练环境,任务结果由数据库真值而非截屏评分。在其上训练的 9B 模型在十四个域上平均分从 36.5% 提升到 67.1%,与 GPT-5.4 的 80.7% 相差十四分;用同一批环境做强化学习,五个世界留出集的评委分从 58% 升到 69%。