MoSAR:学习自适应且可近似注意力几何的语义注意力模式混合
MoSAR 把注意力近似视作几何问题,用输入条件的 query/key 路由器在短、中、全局三种模式间混合,学习连续的距离相关注意力场,并可在训练后经 top-1 路由离散化。在 500M 参数匹配模型的预训练实验中,它未降低语言建模质量,困惑度优于 dense RoPE,长度外推下优于 ALiBi 等基线取得最佳困惑度。
MoSAR 把注意力近似视作几何问题,用输入条件的 query/key 路由器在短、中、全局三种模式间混合,学习连续的距离相关注意力场,并可在训练后经 top-1 路由离散化。在 500M 参数匹配模型的预训练实验中,它未降低语言建模质量,困惑度优于 dense RoPE,长度外推下优于 ALiBi 等基线取得最佳困惑度。
一种 Metric-based Loss Weighting 训练方法利用 PCXMI 和 Congruency-based PCXMI 识别受益于图像的 token,在 CoMMuTE 对比数据集上使多模态机器翻译准确率较标准微调最高提升超过 7 个百分点。该方法通过微调三个预训练多模态大语言模型,在三个语言方向的图像引导机器翻译任务上评估,并保持较强通用翻译性能。
CG-Probes 用差值均值法在冻结嵌入器的归一化空间中探测线性方向,可将患者查询嵌入中的紧急度风险轴恢复出来。该方法用 BERTopic 聚类 79,658 条捷克语肿瘤科查询生成对比风险样本,在 200 条经两名肿瘤科医生评分的查询上与开放权重 LLM 表现相当且延迟更低,每轴输出标量分数供医生设定升级阈值。
ZooWork-ShopRanker 是一组电商开源偏好对齐重排序器,含 0.6B、4B、8B 三个规模,训练标签由多个推理 LLM 组成的偏好评审团生成。其 8B 旗舰作为蒸馏教师训练 4B 与 0.6B,并发布含约 10,000 对私域流量偏好对的 ShopRank-Bench。
FAVoR(Federated Authorial Voice Retention)提出一种面向联邦 PEFT 的作者风格残差机制,用于缓解多作者适配中不同作者生成结果在风格空间难以区分的同质化问题。
EoupCT 提出估计并正交化未知预训练梯度的框架,用于 LLM 持续微调以缓解灾难性遗忘。它用带 Gumbel-Softmax 松弛的可学习软提示生成新任务最易遗忘的伪数据来估计预训练梯度,并以一阶高效 Pareto 优化器联合优化 LLM 参数与软提示,强制新任务更新与估计梯度正交。多个 LLM 实验显示可兼顾任务能力与通用知识,该工作已被 NeurIPS 2026 接收。
持续负样本对抗蒸馏用历史提示词匹配的师生对比样本替换部分判别器批次,缓解黑盒在线策略蒸馏中负样本分布随策略更新漂移的移动目标问题。在匹配判别器算力下,该方法跨两个学生模型家族、三个评判模型与四个评判对话基准稳定优于现有方法。其贝叶斯最优奖励为教师到负样本的对数密度比,持久负样本可锚定判别器并降低奖励估计 MSE。
在从教师到学生的知识蒸馏中,提示词模板选择会显著削弱学生模型已有的安全对齐:聊天模板比非聊天模板让模型更顺从有害查询。该现象在 LLaMA、Gemma 和千问(Qwen)三个模型家族及多个安全基准上一致。非聊天模板蒸馏更能保留学生模型内部表示,聊天模板蒸馏则导致更大的表示偏移。
KAME 提出随机中间引导(randomized intermediate guidance),直接从对话语料提取引导信号,省去模拟 LLM 生成缺失引导的数据准备开销。在合成对话上,其回复质量与 LLM 生成引导、相似度基线相当。用 3.8k 小时真实对话训练后,轮次切换更顺畅、audio-judge 自然度优于合成数据版 KAME,并保持对 Moshi 的回复质量优势。
针对 SnapKV、PyramidKV 等只按平均注意力排序 token 的 KV cache 驱逐方法,该研究提出加入注意力离散度与冗余惩罚的统一打分,其相似度惩罚无需额外前向。
研究提出由 DCE 与 SRCL 构成的递归在线策略蒸馏框架,让特权教师模型与学生共同演化,在四个竞赛级数学基准上超越 OPSD。在 Qwen3-8B 上,DCE+SRCL 达到 65.97% Average@12,比 OPSD 高出 35.62 个百分点。SRCL 额外以模型自身在线响应更短、经核验的改写进行训练,使平均输出长度较仅用 DCE 减少 7.80%。
用 LLM 向英语、荷兰语、中文 BabyBabelLM 语料注入词级与句级语码切换后再预训练小型 decoder-only Transformer,可让平行文本表征(尤其跨书写系统)趋于对齐。按词级语码切换→句级语码切换→单语文档的课程训练,模型在 BabyLM 评测套件上优于未使用该数据的基线。代码、数据与模型已公开。
SRBench 基准数据集以 45,064 条标注数据评估 LLM 在系统性综述(SR)筛选中的表现,覆盖 32 项精选二次研究。其评测框架考虑 SR 中排除文章天然多于纳入文章的类别不平衡问题,并指出传统指标在这类高度不平衡场景下可能产生误导;配套的 PromptSR 工具支持提示词实验、实验管理与结果分析。
Spotify 提出多轮合成数据生成管线与自我改进循环,在冷启动阶段优化对话式推荐智能体的规划与工具调用,规划质量在高度优化的人工提示词基础上再提升 8%。自我改进循环结合基于方差的对比优化与编码智能体的迭代修正,自动定位并修复规划与工具调用错误。系统已在 Spotify 落地,线上 A/B 测试显示用户收听提升 14%、周活跃用户提升 5%、跳过率下降 5%。
CMU 团队提出 MetaLint,把代码 linting 形式化为指令跟随任务,模型按自然语言规范判断代码是否符合最佳实践,无需重训即可泛化到未见或演进中的规则。
研究团队将聚敛与区分效度检验适配到 AI 基准评估,并用 IRT 模型在题目层面逐题分析,实现更细粒度效度检验。结果显示,偏差基准 BBQ 可能在测推理而非偏差,偏差基准按任务形式聚簇而非宣称的性别种族偏差;推理、知识、理解类基准高度相关或测同一概念。同类安全基准相关性弱、偏差定义不一,53 个模型、56 项基准的逐题输出数据集已公开发布。
研究发现,声称测量相似安全概念的 AI 基准之间相关性往往很弱,「偏差」等安全概念在各基准中的概念化方式不一致,跨基准的安全结论难以直接比较。研究提出用聚敛与区分效度系统评估 AI 基准有效性,并指出偏差基准 BBQ 可能实际在测推理、偏差基准按任务形式聚簇而非宣称的性别种族偏差。53 个模型、56 项基准的逐题输出数据集已公开发布。
一项研究观察到,声称分别测量推理、知识与理解的 AI 基准之间相关性很强,暗示这些基准可能并未捕捉到相互独立的概念,其区分度存疑。该研究主张用聚敛与区分效度系统评估 AI 基准有效性,并把心理测量效度检验移植到 AI 基准与 IRT 逐题分析。同时公开发布了覆盖 53 个模型、56 项基准的逐题输出数据集。
研究团队用聚敛与区分效度方法检验 AI 基准,发现偏差基准 BBQ 可能实际测量的是推理能力而非偏差。BBQ 常是商业模型发布中使用的唯一偏差基准,其结论可能被系统性误读。研究还公开发布了 53 个模型、56 项基准的逐题输出数据集。
音乐初创公司 Thoughtful Things 在 Kickstarter 上线采样器 Engram,用本地「tiny AI」把 AI 模型的幻觉变成实验声音。Engram 不联网,模型由公司自研,仅用 CC-BY 等商用授权音频训练,固件将开放以便加载自定义模型。Kickstarter 限量首发 675 美元起,零售价尚未公布,预计在 850-900 美元之间。
Google MaxText 团队在 Cloud TPU 上从头复现了 Ai2 的 Olmo 3 7B 预训练与中期退火,阶段 1、阶段 2 的损失曲线与 Ai2 公开参考在留出评估上对齐。
Dell Technologies 将于 10 月 6–7 日举办“AI Data Platform Event: From Ambition to AI at Scale”线上活动,theCUBE 同步直播并由分析师 Dave Vellante、John Furrier 进行独家访谈。
小型神经网络在模加法任务上训练到 20000 步时,对新问题的准确率从 1000 步时的约 10% 跃升至接近 100%,这一现象被命名为 grokking。2023 年的后续研究发现,网络自行学会把数字表示为圆上的位置并用旋转组合,相当于重新发现了三角函数。研究者指出,标准 early stopping 规则可能在性能平台期提前切断训练,而 grokking 目前仅在少数窄的规则任务中被记录。
作者提出用对抗验证检测数据漂移,给训练集打 0、生产批次打 1 训练分类器,AUC 接近 0.5 说明分布一致,超过约 0.65 则说明特征间的联合关系已变化,并能指出具体是哪些列。
英国创业公司 Worldmodeldata 正把游戏手柄输入等游戏操作数据打包成训练数据集,供世界模型使用,公司由 Yann LeCun 担任顾问。CEO Rhea Loucas 称已从多款热门游戏背后的工作室授权近 100 万小时数据,但拒绝透露是哪些游戏,未来还计划让玩家个人获得补偿。
研究审计 AlphaEarth 对 162 个国家 1000 个城市区域的嵌入表示,发现它支持跨区域比较,却压缩了城市内部差异。城市嵌入落在偏离全球均值方向 62.7° 的偏移重叠区域,城市化程度仅解释 8.9% 的城市内变异。城市中心离散度随国家发展水平每标准差高 14.1%,表示的年际变化近八倍于像素重绘所能解释。
作者把 gpt-6-astra 和 gpt-5-nano 生成的 400 条影评混入 Mendeley 的 200 条真人参考影评,实测 perplexity、近重复相似度和嵌入密度三种 AI 文本检测方法。
实验提出 hRoPE,为段落、句子和 token 索引各设相互独立的旋转通道,以检验 Transformer 的位置编码是否丢失层级信息。在 WikiText-2、OpenWebText 和 Python 源码三个语料上,抹掉真实段落边界会降低跨段注意力,插入假边界则抬高它。
NetApp 将在 NetApp INSIGHT 大会上阐述其统一存储支撑生产级 AI 的战略,theCUBE 于 9 月 30 日独家直播。theCUBE 研究显示,64% 的组织已将 AI 驱动功能直接集成进软件交付流水线。分析师 Krista Case 与 Paul Nashawaty 指出,统一存储能让训练、RAG、推理和智能体工作负载持续获取受治理的数据,减少数据碎片化与运营复杂度。
Datacor 将 Amazon Quick Sight 嵌入 TrackAbout,为气体与焊接分销商提供自助式租赁分析仪表盘与自然语言搜索栏。TrackAbout 客户合计管理 2750 万个资产、每月超 72.5 万张账单,此前租金数据只能靠 IT 生成的报告获取。自然语言问答由 Amazon Q in Quick Sight 驱动。
Amazon SageMaker HyperPod 搭配 Qumulo 的 CNQ 与 Cloud Data Fabric(CDF),让训练集群无需复制数据即可读取另一 AWS Region 的数据集。
作者在系列第二部分对比多步概率预测的两种做法:确定性 rollout 只把预测均值 μ 回喂作为上下文,随机 rollout 则从预测的高斯分布采样后回喂,两者代码只差一行。
作者在没有 PyTorch 和自动微分的情况下,用纯 NumPy 手写反向传播,复现了 Anthropic 2022 年论文《Toy Models of Superposition》的实验。
TF-IDF 被拆成 tokenization、词表、TF、IDF、Python 实现、PCA 可视化与文本分类,解释文本如何转为数字向量。4 条示例文档中,TF 看词在单篇中的频率,IDF 由 DF 衡量词在全部文档中的稀有度,TF×IDF 得到 TF-IDF。最后列出 TF-IDF 的局限,并转向嵌入向量。
GRPO 让模型对同一问题采样多次作答,用可验证奖励为每个答案打分,再以组内平均奖励为基线比较各次尝试来更新模型,无需单独的 critic。该方法由 DeepSeekMath 工作提出,用以替代传统 PPO 的内存开销,文中用「6 箱每箱 8 件、卖出 6 件、答案 42」的算术题演示打分与优势计算。组内奖励完全一致时优势全为零,模型无法判断该偏好哪次尝试。
作者用 500 局 CartPole 数据训练了一个 13,635 参数的 GRU 世界模型,预测下一步状态变化与是否翻车。该模型单步预测误差为 3.8 毫米车位置和 0.00026 弧度杆角,可信滚动预测视界为 29 步;配合 200 条随机动作序列的规划,100 局全部拿到 500/500。
推荐理由:从 CartPole 出发手写世界模型,对比 DQN 展示同一模型如何零重训切换目标。
GPT-6 Astra 帮助 Parallel 的智能体将劳动力市场数据的调研与综合时间及成本各削减一半,对比对象为此前使用的模型。
小米发布 MiMo-V2.6 系列开放权重模型,包含原生全模态的 MiMo-V2.6-Pro、MiMo-V2.6-Flash 以及 MiMo-V2.6-Pro-UltraSpeed,其中 Pro 以 1.02T 总参数、42B 激活参数在 Artificial Analysis 智能指数上以 46 分成为该榜首位开放权重模型。
推荐理由:原文给出 MiMo-V2.6 的 RL 训练细节与开源清单,可对照开放权重模型的成本与复现门槛。
TypeSafe AI 的 Diogo Almeida 在 Latent Space 播客中介绍新模型 Jev,把它定义为以代码为消费方、按每美元智能优化的 System 1 模型。
TS-DFM 用能量导航替代离散流匹配训练中的盲随机跳步:轻量能量罗盘在每个中间点评估候选续写、选出最连贯的一支,且塑造仅在训练期进行,推理成本不变。在 170M 参数语言建模上,8 步学生模型的困惑度比 1024 步教师低 32%、速度快 128×,增益在多种源分布和三种规模递增的评估器上一致。其困惑度优于所有对比的离散生成基线,包括训练数据多 6× 或模型大 5× 的方法。