破解「深度诅咒」:Kimi K3、DeepSeek V4 各押注不同残差方案
Kimi K3 采用 AttnRes、DeepSeek V4 采用 mHC,ByteDance 则提出 HC,三者以不同残差方案应对大模型「深度诅咒」。由于三种方法的训练预算、模型设计与代码库各不相同,无法直接比较优劣。DepthBench 试图对这些深度扩展方案做统一评测。
Kimi K3 采用 AttnRes、DeepSeek V4 采用 mHC,ByteDance 则提出 HC,三者以不同残差方案应对大模型「深度诅咒」。由于三种方法的训练预算、模型设计与代码库各不相同,无法直接比较优劣。DepthBench 试图对这些深度扩展方案做统一评测。
Google 发布 TabFM,一个 400M 参数的表格数据基础模型,把监督表格预测建模为上下文学习,单次前向即可输出经过校准的零样本预测,无需任务专属调优。
NVIDIA 发布开源表格预测基础模型 Kumo Tabular,给定带标签的表格行和待预测行,单次前向推理即可返回类别概率或数值预测,无需训练、调参和特征工程。
NVIDIA 发布并开源表格数据基础模型系列 Kumo Tabular,开放权重且可商用,由 Jure Leskovec 团队推出。该模型只需提供带标签的表格数据即可使用,支持分类与回归任务。官方称其在精度与推理时间的权衡上建立了新的 Pareto 前沿。
GPT-6 Astra 帮助 Parallel 的智能体将劳动力市场数据的调研与综合时间及成本各削减一半,对比对象为此前使用的模型。
小米发布 MiMo-V2.6 系列开放权重模型,包含原生全模态的 MiMo-V2.6-Pro、MiMo-V2.6-Flash 以及 MiMo-V2.6-Pro-UltraSpeed,其中 Pro 以 1.02T 总参数、42B 激活参数在 Artificial Analysis 智能指数上以 46 分成为该榜首位开放权重模型。
推荐理由:原文给出 MiMo-V2.6 的 RL 训练细节与开源清单,可对照开放权重模型的成本与复现门槛。
IBM Granite 团队发布 Granite 4.2 推理模型系列,包含 3B、8B、30B 三个 dense、decoder-only 规模,全部以 Apache 2.0 许可开放。
推荐理由:原文公开了从五阶段预训练到多阶段 RL 的完整构建配方,可对照其他推理模型的开源训练路径。
Google DeepMind 的 WeatherNext AI 模型在气旋路径、强度和风场结构预测上达到当前最优精度,平均为预报员多争取约一天的有效提前量,成果发表在 Nature。
推荐理由:原文给出气旋路径与强度预测的领先幅度,并公开模型权重与代码,可对照传统预报方法理解改进来源。
NVIDIA 发布 Cosmos-H-Dreams,一款面向手术机器人的实时、动作条件生成式模拟器,把 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型。
Mistral AI 发布 Robostral Navigate,一个仅用单个 RGB 相机的 8B 具身导航模型,在 R2R-CE validation unseen 上达到 76.6% 成功率。它完全不用 LiDAR 或深度传感器,成绩比最佳单相机方案高 9.7 分,比使用深度或多相机的最佳系统高 4.5 分。模型完全基于仿真数据自研训练,可泛化到轮式、足式与飞行机器人。
Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,把表格预测重构为上下文学习问题,单次前向即可出预测,无需模型训练、超参调优和特征工程。