NVIDIA 发布开源表格预测基础模型 Kumo Tabular
NVIDIA 发布开源表格预测基础模型 Kumo Tabular,给定带标签的表格行和待预测行,单次前向推理即可返回类别概率或数值预测,无需训练、调参和特征工程。
NVIDIA 发布开源表格预测基础模型 Kumo Tabular,给定带标签的表格行和待预测行,单次前向推理即可返回类别概率或数值预测,无需训练、调参和特征工程。
深度学习和 Keras 正被用于解码天体粒子物理的宇宙信号,宇宙线、伽马射线和中微子由跨数千平方公里的观测站以纳秒分辨率记录成波形。Pierre Auger Observatory 的 1500 多个探测器站覆盖 3000 km²,IceCube 用约 1 km³ 南极冰探测中微子。10¹⁹ eV 以上粒子通量仅每平方公里每世纪约 100 个,深度学习可提升仪器灵敏度并发现隐藏模式。
Google 团队发布 autofinetune,把自治研究循环用于 LLM 后训练,智能体在 Tunix、Gemma 和 Cloud TPU 上自动改脚本、跑训练并保留或回滚实验。
Google MaxText 团队在 Cloud TPU 上从头复现了 Ai2 的 Olmo 3 7B 预训练与中期退火,阶段 1、阶段 2 的损失曲线与 Ai2 公开参考在留出评估上对齐。
Datacor 将 Amazon Quick Sight 嵌入 TrackAbout,为气体与焊接分销商提供自助式租赁分析仪表盘与自然语言搜索栏。TrackAbout 客户合计管理 2750 万个资产、每月超 72.5 万张账单,此前租金数据只能靠 IT 生成的报告获取。自然语言问答由 Amazon Q in Quick Sight 驱动。
Amazon SageMaker HyperPod 搭配 Qumulo 的 CNQ 与 Cloud Data Fabric(CDF),让训练集群无需复制数据即可读取另一 AWS Region 的数据集。
GPT-6 Astra 帮助 Parallel 的智能体将劳动力市场数据的调研与综合时间及成本各削减一半,对比对象为此前使用的模型。
TS-DFM 用能量导航替代离散流匹配训练中的盲随机跳步:轻量能量罗盘在每个中间点评估候选续写、选出最连贯的一支,且塑造仅在训练期进行,推理成本不变。在 170M 参数语言建模上,8 步学生模型的困惑度比 1024 步教师低 32%、速度快 128×,增益在多种源分布和三种规模递增的评估器上一致。其困惑度优于所有对比的离散生成基线,包括训练数据多 6× 或模型大 5× 的方法。
DACA-GRPO 为扩散语言模型强化学习引入去噪感知信用分配,可作为任意 GRPO 训练器的轻量即插即用增强。在三种 GRPO 基线方法上,它在涵盖数学推理、代码生成、约束满足与 JSON schema 遵循等七个 benchmark 上取得一致提升,最高增益分别为 5.6pp、7.4pp、36.3pp 和 5.9pp。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习把奖励对齐的查询 fan-out 编译成监督信号,蒸馏进仅 53.9M 参数的扩散检索器,实现单次非自回归查询扩展。该框架微调 Gemma3-4B 和 Qwen3-4B,以集合级奖励评估整组结果,绕开零样本 LLM 的语义重复与数百个 CoT 推理 token 带来的自回归延迟。
费城儿童医院(CHOP)用基于 MONAI 的开源 AI 心脏建模服务,把生成解剖精确心脏模型的时间从 4 小时压缩到几秒,全美已有 20 多家儿童医院运行心脏建模项目。
César de la Fuente 的实验室用 Codex 和 ChatGPT 在现存与已灭绝生物的基因组中搜索抗菌候选分子,目标是应对耐药感染。
Cloudera 与 Mistral 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中运行推理并保留完全控制权。企业还可在受控环境内用大量专有数据训练自定义模型,并以开放权重拥有数据和模型智能。Cloudera 平台承载着 30 exabytes 的客户管理数据。
TRL v1.14 的 AsyncGRPOTrainer 已支持只训练 LoRA 适配器并把它同步到 vLLM,这篇实践在此基础上把训练与推理拆到不同机器上。训练器、两个 vLLM 副本各跑一个 HF Jobs,通过挂载同一个 Storage Bucket 传递适配器而不依赖 NCCL,中间的一个代理负责按 KV 前缀路由 rollout 并向所有副本广播适配器加载。
推荐理由:这篇实践给出跨 Job 的 LoRA 异步 GRPO 配方与代理路由细节,其瓶颈定位方法可迁移到其他异步训练部署。
OpenAI 内部,编程智能体正在重塑 AI 研究。OpenAI 公布了关于智能体使用情况、实验速度、任务复杂度以及研究加速的早期数据。
Google Research 用 UK Biobank 欧洲人群数据向 Biobank Japan 迁移学习,评估跨人群多基因风险评分(PRS)的表现。在八项临床性状上,目标人群样本达 15k 以上时混合欧洲数据反而限制精度提升,仅 5,000 样本时混合 UKB 数据仍有增益。遗传相关性高的性状在目标样本 25-40k+ 前仍受益于混合训练,HDL、LDL 和血糖等高度人群特异性性状受益较小。
该指南用 TRL 对 LFM2.5-350M 做 GRPO 微调,在 IFStruct 基准上的通过率从 22.6% 提升到 29.7%。训练约用 500 条 Nemotron 结构化输出样本、100 步,LoRA 只训练约 6M 参数,可在免费 Colab 或 Kaggle GPU 上跑,评测则在本地通过 llama.cpp 完成。
作者用 TRL 和 OpenEnv 复现了让语言模型写 p5.brush 代码画水彩的训练流程,把参考池、RL 环境、训练脚本和训练好的模型全部开源在 Hugging Face 上,想法源自 Surya Narreddi 走红的模型水彩画视频。
推荐理由:整套训练流水线、参考池和三组奖励配比的产物都已开源,可据此复现用奖励模型训练模型画画的流程。
Google 提出 MAPL-EMIT 深度学习框架,基于 Swin-S vision transformer 处理 NASA EMIT 卫星高光谱数据,可同时量化甲烷增强、分割羽流范围并定位点源,在专家标注羽流上召回率达 84%。
GlucoFM 是面向连续血糖监测(CGM)的自监督基础模型,双流设计分离慢速血糖趋势与短期偏差。它基于 109,066 小时无标注 CGM 数据预训练,在 14 项队列-任务评估中平均 PR-AUC 比最佳 GluFormer 变体高 5.8 个百分点。餐后血糖响应预测中其 MAE 在 Dexcom 和 Libre 上最低,并具备最佳跨数据集迁移能力。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式后期交互检索,并配套完整的训练与微调流程。
推荐理由:文中给出可直接运行的微调脚本和六种起点对比,读者可据此判断在自有领域数据上训练多向量检索模型的成本。
IBM Granite 团队发布 Granite 4.2 推理模型系列,包含 3B、8B、30B 三个 dense、decoder-only 规模,全部以 Apache 2.0 许可开放。
推荐理由:原文公开了从五阶段预训练到多阶段 RL 的完整构建配方,可对照其他推理模型的开源训练路径。
Quantization-Aware Healing(QAH)让 GPT-OSS 120B 压缩到 60B、量化为 MXFP4 后,在 9 项基准中 7 项超过其 bfloat16 全精度版本。
Meta 公布 MTIA 300,这是其自研芯片家族中首款面向推荐与排序模型训练优化的加速器。芯片封装内集成两个网络 chiplet,各含 6 个定制 800 Gbps RDMA NIC,总 I/O 带宽 1.2 TB/s,另有 16 个消息引擎(ME)独立承担通信,使大 GEMM 与集合通信并发时计算吞吐下降小于 0.5%。
Google Research 提出 ME-POIs 框架,将匿名聚合移动性模式与语言模型的地点文本嵌入对齐,生成同时编码地点身份与动态功能的嵌入向量。在公开基准上,该框架对未见地点的访问意图预测相对提升最高 81.9%,价格等级分类提升 75.1%,繁忙度估计准确率提升 24.7%。其流程包含访问对齐、空间多尺度访问传播和文本-移动性协同,用于缓解长尾地点数据稀疏问题。
Google Research 提出 PhotoScan,可用普通手机 2D 照片估算体脂率、A/G 比和 V/S 比三项体成分指标。该框架在 UK Biobank 超过 3.5 万条记录上预训练,再用 677 名成人的手机照片配对 DXA 数据微调,并在 132 人的独立队列中验证。
Multiverse Computing 提出离线缓存教师 top-100 logits 和融合分块 KL 损失两项改动,让知识蒸馏不必同时把教师与学生模型放在显存里。
Google DeepMind 的 WeatherNext AI 模型在气旋路径、强度和风场结构预测上达到当前最优精度,平均为预报员多争取约一天的有效提前量,成果发表在 Nature。
推荐理由:原文给出气旋路径与强度预测的领先幅度,并公开模型权重与代码,可对照传统预报方法理解改进来源。
微软研究院发布 Echoverse,为 computer-use 智能体构建十二个高保真合成训练环境,任务结果由数据库真值而非截屏评分。在其上训练的 9B 模型在十四个域上平均分从 36.5% 提升到 67.1%,与 GPT-5.4 的 80.7% 相差十四分;用同一批环境做强化学习,五个世界留出集的评委分从 58% 升到 69%。
NVIDIA 发布 Cosmos-H-Dreams,一款面向手术机器人的实时、动作条件生成式模拟器,把 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型。
Grabette 是一个开源低成本手持夹爪系统,用于记录机器人操作演示并自动生成可训练的 LeRobot 数据集,无需真实机器人。手持端 BOM 约 490€,配套电动夹爪 Gripette 约 120€,处理流程在浏览器中经 RTAB-MAP SLAM 完成并上传至 Hugging Face Hub。设计灵感来自斯坦福 UMI,示例用 200 条演示训练 Diffusion Policy。
Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力来自 score smoothing,而非偶然。训练中的正则化让神经网络学到的 score function 更平滑,去噪时样本落在训练数据点之间,形成插值生成。1-D 实验中 weight decay 越强 score function 越平滑,无显式正则化时的隐式正则化也有同样效果。
Google Research 提出大型传感器基础模型 SensorFM,基于 500 万名同意参与者、超过一万亿分钟的无标签多模态可穿戴数据完成预训练。在来自三项研究、共 13985 名参与者、覆盖心血管、代谢、心理健康、睡眠、人口统计和生活方式六类的 35 项健康任务中,冻结编码器加线性探针在 34 项上优于人工特征监督基线。
推荐理由:从超一万亿分钟无标签数据预训练的通用表征,读者可了解它如何在心血管、代谢、睡眠等多类健康任务间迁移。
Mistral AI 发布 Robostral Navigate,一个仅用单个 RGB 相机的 8B 具身导航模型,在 R2R-CE validation unseen 上达到 76.6% 成功率。它完全不用 LiDAR 或深度传感器,成绩比最佳单相机方案高 9.7 分,比使用深度或多相机的最佳系统高 4.5 分。模型完全基于仿真数据自研训练,可泛化到轮式、足式与飞行机器人。
LeRobot 发布 v0.6.0,围绕机器人学习闭环引入可想象未来的世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、奖励模型 API(lerobot.rewards)以及部署 CLI lerobot-rollout。
推荐理由:从世界模型策略到奖励模型、部署 CLI 与六套仿真基准,这篇发布说明勾勒出机器人学习闭环的工具链全貌。
PRX 系列第 4 篇披露其数据策略:预训练语料由公开与内部数据集混合构建,图像经 VLM 重新生成描述,供 7B 模型预训练使用。文本编码器从 T5Gemma 换成 Qwen3-VL 后改为训练中实时计算 text latents,吞吐损失约 3–4%,30 天训练约多 1 天。数据以 Lance 构建、MDS 流式训练,图像统一编码为 JPEG quality 92。
Google Research 将 Heat Resilience 屋顶反照率数据扩展至 9 个国家 50+ 城市,并上线高分辨率 Heat Resilience Earth Engine App。
Dharma AI 撰文解读 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 的论文,该论文主张 AI 专业化不可避免。文章引述 1997 年 Wolpert 与 Macready 的优化理论证明:没有算法能在所有问题上占优,通用性不构成性能优势,任务集无限扩张时每任务资源趋近于零。进化生物学与市场竞争给出同一预测,论文称通用性在实践中是神话。
Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,把表格预测重构为上下文学习问题,单次前向即可出预测,无需模型训练、超参调优和特征工程。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,评测分数可同时出现在 Hugging Face 模型页和 benchmark 排行榜,并带徽章链接回完整 EEE 记录。