DACA-GRPO:面向扩散语言模型强化学习的去噪感知信用分配
DACA-GRPO 为扩散语言模型强化学习引入去噪感知信用分配,可作为任意 GRPO 训练器的轻量即插即用增强。在三种 GRPO 基线方法上,它在涵盖数学推理、代码生成、约束满足与 JSON schema 遵循等七个 benchmark 上取得一致提升,最高增益分别为 5.6pp、7.4pp、36.3pp 和 5.9pp。
DACA-GRPO 为扩散语言模型强化学习引入去噪感知信用分配,可作为任意 GRPO 训练器的轻量即插即用增强。在三种 GRPO 基线方法上,它在涵盖数学推理、代码生成、约束满足与 JSON schema 遵循等七个 benchmark 上取得一致提升,最高增益分别为 5.6pp、7.4pp、36.3pp 和 5.9pp。
Good Start Labs 把 Diplomacy、1830 等游戏当作 AI 模型的训练环境,其 30B 模型实验显示只有 multi-turn terminal agent 设计提升了 Finance-Agent benchmark 表现,单轮问答设计仅改善游戏内目标。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习把奖励对齐的查询 fan-out 编译成监督信号,蒸馏进仅 53.9M 参数的扩散检索器,实现单次非自回归查询扩展。该框架微调 Gemma3-4B 和 Qwen3-4B,以集合级奖励评估整组结果,绕开零样本 LLM 的语义重复与数百个 CoT 推理 token 带来的自回归延迟。
费城儿童医院(CHOP)用基于 MONAI 的开源 AI 心脏建模服务,把生成解剖精确心脏模型的时间从 4 小时压缩到几秒,全美已有 20 多家儿童医院运行心脏建模项目。
Dwarkesh Patel 在新一期播客中与 John Schulman、Beren Millidge 和 Charlie O'Neill 讨论递归自我改进(RSI)离我们还有多远。
César de la Fuente 的实验室用 Codex 和 ChatGPT 在现存与已灭绝生物的基因组中搜索抗菌候选分子,目标是应对耐药感染。
Cloudera 与 Mistral 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中运行推理并保留完全控制权。企业还可在受控环境内用大量专有数据训练自定义模型,并以开放权重拥有数据和模型智能。Cloudera 平台承载着 30 exabytes 的客户管理数据。
TRL v1.14 的 AsyncGRPOTrainer 已支持只训练 LoRA 适配器并把它同步到 vLLM,这篇实践在此基础上把训练与推理拆到不同机器上。训练器、两个 vLLM 副本各跑一个 HF Jobs,通过挂载同一个 Storage Bucket 传递适配器而不依赖 NCCL,中间的一个代理负责按 KV 前缀路由 rollout 并向所有副本广播适配器加载。
推荐理由:这篇实践给出跨 Job 的 LoRA 异步 GRPO 配方与代理路由细节,其瓶颈定位方法可迁移到其他异步训练部署。
Dwarkesh Patel 用 2019 至 2025 年逐年代表性的模型配方与公开数据语料组合做小规模预训练实验,发现在 1e19 FLOPs 算力预算下,数据改进带来 12.0x 算力效率提升,模型改进为 3.7x,前者是后者的 3.24x。
OpenAI 内部,编程智能体正在重塑 AI 研究。OpenAI 公布了关于智能体使用情况、实验速度、任务复杂度以及研究加速的早期数据。
Google Research 用 UK Biobank 欧洲人群数据向 Biobank Japan 迁移学习,评估跨人群多基因风险评分(PRS)的表现。在八项临床性状上,目标人群样本达 15k 以上时混合欧洲数据反而限制精度提升,仅 5,000 样本时混合 UKB 数据仍有增益。遗传相关性高的性状在目标样本 25-40k+ 前仍受益于混合训练,HDL、LDL 和血糖等高度人群特异性性状受益较小。
该指南用 TRL 对 LFM2.5-350M 做 GRPO 微调,在 IFStruct 基准上的通过率从 22.6% 提升到 29.7%。训练约用 500 条 Nemotron 结构化输出样本、100 步,LoRA 只训练约 6M 参数,可在免费 Colab 或 Kaggle GPU 上跑,评测则在本地通过 llama.cpp 完成。
作者用 TRL 和 OpenEnv 复现了让语言模型写 p5.brush 代码画水彩的训练流程,把参考池、RL 环境、训练脚本和训练好的模型全部开源在 Hugging Face 上,想法源自 Surya Narreddi 走红的模型水彩画视频。
推荐理由:整套训练流水线、参考池和三组奖励配比的产物都已开源,可据此复现用奖励模型训练模型画画的流程。
Google 提出 MAPL-EMIT 深度学习框架,基于 Swin-S vision transformer 处理 NASA EMIT 卫星高光谱数据,可同时量化甲烷增强、分割羽流范围并定位点源,在专家标注羽流上召回率达 84%。
GlucoFM 是面向连续血糖监测(CGM)的自监督基础模型,双流设计分离慢速血糖趋势与短期偏差。它基于 109,066 小时无标注 CGM 数据预训练,在 14 项队列-任务评估中平均 PR-AUC 比最佳 GluFormer 变体高 5.8 个百分点。餐后血糖响应预测中其 MAE 在 Dexcom 和 Libre 上最低,并具备最佳跨数据集迁移能力。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式后期交互检索,并配套完整的训练与微调流程。
推荐理由:文中给出可直接运行的微调脚本和六种起点对比,读者可据此判断在自有领域数据上训练多向量检索模型的成本。
Dwarkesh Patel 与 SemiAnalysis 创始人 Dylan Patel 在播客中讨论实验室经济,判断 Anthropic 和 OpenAI 到 2028 年将掌握全球大部分可用算力。
IBM Granite 团队发布 Granite 4.2 推理模型系列,包含 3B、8B、30B 三个 dense、decoder-only 规模,全部以 Apache 2.0 许可开放。
推荐理由:原文公开了从五阶段预训练到多阶段 RL 的完整构建配方,可对照其他推理模型的开源训练路径。
Quantization-Aware Healing(QAH)让 GPT-OSS 120B 压缩到 60B、量化为 MXFP4 后,在 9 项基准中 7 项超过其 bfloat16 全精度版本。
Meta 公布 MTIA 300,这是其自研芯片家族中首款面向推荐与排序模型训练优化的加速器。芯片封装内集成两个网络 chiplet,各含 6 个定制 800 Gbps RDMA NIC,总 I/O 带宽 1.2 TB/s,另有 16 个消息引擎(ME)独立承担通信,使大 GEMM 与集合通信并发时计算吞吐下降小于 0.5%。
Google Research 提出 ME-POIs 框架,将匿名聚合移动性模式与语言模型的地点文本嵌入对齐,生成同时编码地点身份与动态功能的嵌入向量。在公开基准上,该框架对未见地点的访问意图预测相对提升最高 81.9%,价格等级分类提升 75.1%,繁忙度估计准确率提升 24.7%。其流程包含访问对齐、空间多尺度访问传播和文本-移动性协同,用于缓解长尾地点数据稀疏问题。
Google Research 提出 PhotoScan,可用普通手机 2D 照片估算体脂率、A/G 比和 V/S 比三项体成分指标。该框架在 UK Biobank 超过 3.5 万条记录上预训练,再用 677 名成人的手机照片配对 DXA 数据微调,并在 132 人的独立队列中验证。
Dwarkesh Patel 与 Redwood Research 首席科学家 Ryan Greenblatt 辩论 AI 能否通过自动化 AI 研发实现递归自我改进。
Multiverse Computing 提出离线缓存教师 top-100 logits 和融合分块 KL 损失两项改动,让知识蒸馏不必同时把教师与学生模型放在显存里。
Dwarkesh Patel 发布对持续学习时代的 8 条预测,认为模型权重若随每日部署持续更新,训练完成到部署之间的一次性安全评估将不再适用,对模型厂商的检查更宜改为月度或季度风险巡检。
Google DeepMind 的 WeatherNext AI 模型在气旋路径、强度和风场结构预测上达到当前最优精度,平均为预报员多争取约一天的有效提前量,成果发表在 Nature。
推荐理由:原文给出气旋路径与强度预测的领先幅度,并公开模型权重与代码,可对照传统预报方法理解改进来源。
Dwarkesh Patel 发布视频版文章,探讨更聪明的 AI 模型为何可能将算力价格推高 10 倍。视频为其上周一篇文章的录像版本。该视频由 Mercury 赞助,其内置 AI Command 可自动归类交易、给出每项选择理由,并同步至 QuickBooks。
微软研究院发布 Echoverse,为 computer-use 智能体构建十二个高保真合成训练环境,任务结果由数据库真值而非截屏评分。在其上训练的 9B 模型在十四个域上平均分从 36.5% 提升到 67.1%,与 GPT-5.4 的 80.7% 相差十四分;用同一批环境做强化学习,五个世界留出集的评委分从 58% 升到 69%。
Dwarkesh Patel 在博客中提出,随着模型越发智能、同一份算力能变现更多收入,未来几年 AI 算力价格可能上涨 10 倍以上。
NVIDIA 发布 Cosmos-H-Dreams,一款面向手术机器人的实时、动作条件生成式模拟器,把 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型。
Grabette 是一个开源低成本手持夹爪系统,用于记录机器人操作演示并自动生成可训练的 LeRobot 数据集,无需真实机器人。手持端 BOM 约 490€,配套电动夹爪 Gripette 约 120€,处理流程在浏览器中经 RTAB-MAP SLAM 完成并上传至 Hugging Face Hub。设计灵感来自斯坦福 UMI,示例用 200 条演示训练 Diffusion Policy。
Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力来自 score smoothing,而非偶然。训练中的正则化让神经网络学到的 score function 更平滑,去噪时样本落在训练数据点之间,形成插值生成。1-D 实验中 weight decay 越强 score function 越平滑,无显式正则化时的隐式正则化也有同样效果。
Google Research 提出大型传感器基础模型 SensorFM,基于 500 万名同意参与者、超过一万亿分钟的无标签多模态可穿戴数据完成预训练。在来自三项研究、共 13985 名参与者、覆盖心血管、代谢、心理健康、睡眠、人口统计和生活方式六类的 35 项健康任务中,冻结编码器加线性探针在 34 项上优于人工特征监督基线。
推荐理由:从超一万亿分钟无标签数据预训练的通用表征,读者可了解它如何在心血管、代谢、睡眠等多类健康任务间迁移。
Mistral AI 发布 Robostral Navigate,一个仅用单个 RGB 相机的 8B 具身导航模型,在 R2R-CE validation unseen 上达到 76.6% 成功率。它完全不用 LiDAR 或深度传感器,成绩比最佳单相机方案高 9.7 分,比使用深度或多相机的最佳系统高 4.5 分。模型完全基于仿真数据自研训练,可泛化到轮式、足式与飞行机器人。
LeRobot 发布 v0.6.0,围绕机器人学习闭环引入可想象未来的世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、奖励模型 API(lerobot.rewards)以及部署 CLI lerobot-rollout。
推荐理由:从世界模型策略到奖励模型、部署 CLI 与六套仿真基准,这篇发布说明勾勒出机器人学习闭环的工具链全貌。
PRX 系列第 4 篇披露其数据策略:预训练语料由公开与内部数据集混合构建,图像经 VLM 重新生成描述,供 7B 模型预训练使用。文本编码器从 T5Gemma 换成 Qwen3-VL 后改为训练中实时计算 text latents,吞吐损失约 3–4%,30 天训练约多 1 天。数据以 Lance 构建、MDS 流式训练,图像统一编码为 JPEG quality 92。
Google Research 将 Heat Resilience 屋顶反照率数据扩展至 9 个国家 50+ 城市,并上线高分辨率 Heat Resilience Earth Engine App。
Dwarkesh Patel 与 3Blue1Brown 创始人 Grant Sanderson 对话,讨论 AI 在数学领域进展最快的原因及其对其他行业的参照意义。
Dharma AI 撰文解读 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 的论文,该论文主张 AI 专业化不可避免。文章引述 1997 年 Wolpert 与 Macready 的优化理论证明:没有算法能在所有问题上占优,通用性不构成性能优势,任务集无限扩张时每任务资源趋近于零。进化生物学与市场竞争给出同一预测,论文称通用性在实践中是神话。
Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,把表格预测重构为上下文学习问题,单次前向即可出预测,无需模型训练、超参调优和特征工程。