构建公平评测集是组合优化问题,开源库 datacarve 用整数规划求解
作者 Vasileios Vonikakis 把均衡评测集的构建形式化为整数规划问题,并开源了 Python 库 datacarve,用于在多个属性上同时按目标分布挑选真实数据子集。
作者 Vasileios Vonikakis 把均衡评测集的构建形式化为整数规划问题,并开源了 Python 库 datacarve,用于在多个属性上同时按目标分布挑选真实数据子集。
在 Wired 的访谈中,AI 研究者 Timnit Gebru 表示 AI 并不构成存在性威胁,认为这一叙事不只是分心,而且有害。她把这种叙事追溯到资助 Anthropic 早期融资并资助 METR 等机构的人群,称其为监管俘获的一部分,并援引 Lina Khan 提出的欺骗性营销、数据透明度与数据工人劳动剥削等现有法律本该管辖的事项。
DeepSeek 弹性计算(DSec)团队宣布大量开放招聘名额,尤其需要资深工程师,同时发布技术分享《DeepSeek 弹性计算 (DSec):面向大规模 Agent 训练的沙盒基础设施》。原文将其解读为 DeepSeek 正为 Agent 训练构建沙盒级基础设施,agent 方向的基建投入进入实质扩张阶段。
NVIDIA BioNeMo 团队为 MoE 类稀疏模型推出 GPU 执行优化方案,在 8 张 B200 GPU 上把 Mixtral-8x7B 训练吞吐最高提升 2.21 倍。对比基线为 Hugging Face BF16,方案旨在加速生物基础模型的高效训练。
特斯拉 FSD(Supervised)车队累计真实驾驶里程突破 150 亿英里,每月新增约 10 亿英里数据。特斯拉最新安全报告称,使用 FSD 的车辆重大碰撞、轻微碰撞均减少 7 倍,非高速路段碰撞减少 5 倍。该车队依托全球最大规模的实车数据闭环持续迭代。
澳大利亚一起数据黑客事件曝光,英国媒体 inews 称其揭示了 AI 时代一个日益增长的社会风险,报道指向 OpenAI、Anthropic 等公司与 AI 训练数据相关的问题。相关帖子仅给出原文链接、未摘录正文,具体攻击手法、涉及数据规模与影响范围需阅读原文了解。
RSI Arena 在 COLM 2026 现场开赛,八个 AI 智能体从同一基座模型 Nemotron 3.5 Lightning 30B-A3B 出发,各获 $300 API 额度和 1000 GPU 小时,在 144 小时内自主选数据、定 benchmark、写代码、跑实验来提升模型表现。
SCALPEL 是一种对比式稀疏自编码器,用于表征层的选择性机器遗忘,可缓解重建式提取偏向背景结构、忽略低能量目标成分的能量偏置。在 TOFU 上对 Qwen、Llama、Gemma 的实验中,它优于 NMF 和标准 SAE 干预,与 Gradient Difference、RMU 相当。理论分析显示,对比训练能促进目标选择性特征,其选择分数可控制背景知识扰动的期望。
7 个不同厂商的 LLM 对 S&P 500 财报电话会议记录打分,13 项文本指标(情感、管理层清晰度、不确定性、气候与政治风险等)的跨模型秩相关平均仅 0.52,跨厂商共有的文本差异只解释 34% 的得分变异。
Self-Play Search Distillation(SPSD)通过棋盘游戏自对弈中的 MuZero 类网络搜索生成超人类合成数据,并把搜索记录转成思维链,为大语言模型提供环境接地监督。在 Qwen3-4B-Base 上,六个数学基准的平均分从 24.1 升至 36.6,未见过的游戏胜率从 15% 升至 45%。该方法仅用自对弈搜索记录训练,即可迁移到数学推理。
JevSoup 是一个免训练的 LoRA 组合框架,将 System-One 专家路由与 System-Two 执行分离,仅凭输入和专家描述以结构化概率选出两个专家。
图基础模型 Acacia 仅用 Common Crawl Web 图从零训练,不依赖预训练 LLM,也无需额外训练即可适配新的图和标签。它支持节点分类、链接预测、节点聚类和图生成等任务,并具备上下文学习能力。该结果提供了图模型也能像 LLM 一样从零训练获得涌现能力的证据。
EXAONE Demand 1.0 是面向需求预测的时间序列基础模型,基于 11.3M 条序列、48.4B 观测值和 73 个来源构建需求专用语料。模型在冻结骨干网络上为平滑、间歇、波动、块状四类需求各附加低秩分支,由 router 读取 8 个无量纲统计量分配权重。在 22 个留出数据集上,其真实+合成数据版与纯合成数据版均优于 36 个 TSFM。
TISD 提出一种分支-重生成-蒸馏算法:强制教师选择的轨迹分支动作,由学生生成后续后缀,再用特权上下文条件教师蒸馏完整轨迹。在编码模型上,TISD 较 SDPO 将平均 Avg@4 提升 1.2 个百分点;在科学领域,等步数预算下平均 Avg@128 提升 0.8 分,等时间预算下提升 0.3 分。这些结果支持教师引导的分支可作为暴露有用后继上下文的自蒸馏方式。
ORCA 基准发布,用于评估 LLM 的数据科学代码翻译(DSCT)能力,含 1,600 项 ORCA-MAIN 任务(覆盖 Data Querying、Data Manipulation、Deep Learning)和 200 项 ORCA-PROJECT 完整项目任务。
TGL-NSGA-II 用预训练教师按难度与类别分层、以 KD-Lite 短程蒸馏打分,并融合高斯过程代理,为受限 TinyML 神经架构搜索提供低保真适应度近似。
arXiv 论文 2609.31696 由 Alberto Mancino 等 8 位作者综述推荐系统离线评估的数据处理流程,覆盖数据集选择到训练/验证/测试划分的完整流水线。综述跨越协同过滤、序列、图、多模态、联邦与 LLM 推荐等范式,发现训练前数据处理决策影响算法可得信息、实验可比性与可复现性,但长期缺乏审视、实践高度不一致,并提出统一框架与分类法。
Dr. Free 提出首个不依赖难度奖励的自进化搜索智能体训练框架:从知识图谱采样关系链并配对相关段落,为题目赋予多跳结构,只有完整证据段落下答案的似然超过所有捷径上下文的最大似然时,题目才获得正的信息增益奖励。该奖励基于 teacher-forced 似然计算,免去 pass-rate 估计,大幅缩短 proposer 训练时间。
团队把 AI NPC 模型蒸馏到 2B 参数的 LLM,可运行在消费级 GPU 上,支撑游戏角色的近实时交互。做法是先做 SFT 与 off-policy KD,再用 agentic OPD(on-policy distillation)跟进。团队认为用 API 原型化 AI NPC 没有问题,但 API 很难做到近实时交互。
X 用户 xeophon 质疑「开源模型能力主要靠对抗性蒸馏获得」的说法:若该论断成立,开源模型为何表现能超过闭源模型,且拒绝率更低甚至没有?他补充称自己曾直播强化学习运行过程、开源了部分环境,仍有人不相信其结果,暗示相关能力来源争议更多是立场问题而非证据问题。
Axomap 发布地理空间数据栈(Geospatial Data Stack)市场图谱,收录 62 家公司,分为对地观测与遥感、地理空间数据基础设施、AI 地理空间 API 与上下文基础设施等 7 大类。
Karpathy 的 autoresearch 自动化研究流程一次运行中,智能体尝试 89 个实验来改进一个小模型,到第 44 个实验时已拿到全部收益的 92%。此后机器仍在持续工作,但收益越来越小。作者据此指出,把研究循环自动化并不会让改进自动加速。
Andrew Lampinen 团队发布论文《Passive learning of active causal strategies in agents and language models》,探讨语言模型能否仅靠被动模仿文本习得因果推理与实验能力。
中国气象局9月29日发布《气象数据管理办法》,自11月1日起实施。该办法建立公共气象数据授权运营机制,为公共气象数据确权、授权运营提供明确法规依据,填补制度空白。同时确立数据流通监管平台、各环节安全主体责任、重要数据目录、数据出境与安全评估等制度,并鼓励面向人工智能、大数据开展气象数据开发利用技术与高质量数据集建设。
Reddit 用户提出一种架构思路:softmax 输出受「和为 1」约束、实际只有 N-1 个自由度,可假设 logits 之和为零,让最后一个 logit 由其余 logits 的负和推出,用 N-1 个输入替代 N 个,从而减少最后一层参数或略微加快收敛。发帖人承认该收益在几乎所有场景下都可忽略,并询问是否存在不做它的理论理由。
Uber 工程团队公开特征一致性框架 feature logging,解决训练与推理特征不一致问题:生产环境特征值可能因来源、格式(如 en vs en-US)或计算逻辑差异而与训练数据偏离。该框架从在线推理管道直接产出训练数据,形成训练数据飞轮,在线特征含 userid、语言、餐厅元数据及预计算的历史点击/下单行为特征。Uber Eats 排序模型每秒服务约 800 万次预测。
OpenAI 官方账号发文,阐述其如何为前沿强化学习训练任务(RL training runs)构建安全保障,涉及训练基础设施的防护思路。该聚合来源称,这是头部实验室首次系统性地公开讨论 RL 训练环节的安全框架。
深度学习和 Keras 正被用于解码天体粒子物理的宇宙信号,宇宙线、伽马射线和中微子由跨数千平方公里的观测站以纳秒分辨率记录成波形。Pierre Auger Observatory 的 1500 多个探测器站覆盖 3000 km²,IceCube 用约 1 km³ 南极冰探测中微子。10¹⁹ eV 以上粒子通量仅每平方公里每世纪约 100 个,深度学习可提升仪器灵敏度并发现隐藏模式。
Google 团队发布 autofinetune,把自治研究循环用于 LLM 后训练,智能体在 Tunix、Gemma 和 Cloud TPU 上自动改脚本、跑训练并保留或回滚实验。
SUMI 通过从 EICT 数据蒸馏出光子计数 CT(PCCT)观感,在退化的 PCCT 数据上使 SSIM 提升 35%、PSNR 提升 19%,肺结节检测灵敏度也有所提升。该结果基于模拟数据,作者指出实际临床获益尚未得到证实。
知识蒸馏比普通监督学习更有效,关键在教师模型传递的不是单标签 one-hot,而是完整的概率分布向量 p()。这份分布把类别之间的相似度等「暗知识」一并传给学生,监督信号因此更丰富。
@tokenbender 拆解了采样 softmax 把训练从 67s 提速到 39.9s(1.7 倍)的原理与偏差代价。LM head 对 5 万个 logits 的交叉熵每步吃掉相当大比例算力,而按 Zipf 分布概率质量集中在几千个 logits 上,无需对全部 logits 计算,几乎不损失精度。代价是自归一化带来严重偏差,系统性欠训练尾部 logits。
蒙特利尔 Exploit Summit 议程纪要集中展示 Bittensor 生态版图:Jacob Steeves 提出 Gamma tokens 方案,让子网用部分 emission 向其他子网购买服务,Macrocosmos 发布 iota SDK 与 Liquid Compute 平台用于跨分布式机器训练 AI。
研究者 MoleiTaoMath 将于 9 月 30 日 16-17 点在 UC Berkeley 的 Neyman 统计研讨会(Gateway 1420)演讲,主题为 Scaling Diffusion Language Models(扩散语言模型的扩展)。演讲将覆盖近期的扩散语言模型、test-time scaling(测试时扩展)以及微调方法,欢迎感兴趣的同行现场交流。
LG Innotek 宣布与自动驾驶软件企业 Applied Intuition 合作,在韩国境内部署自动驾驶传感数据采集车辆。其计划以首尔、仁川、京畿道为中心运营车队,到 2028 年部署 20 辆数据采集车和自动驾驶软件开发车,并投放美国、欧洲、日本。车辆搭载摄像头、雷达、激光雷达,采集数据将结合数字孪生环境提升传感器性能、验证系统有效性。
MexHat 是一个面向墨西哥西班牙语视频的仇恨言论检测数据集,包含约 1k 个视频片段,设有三分类(无负面内容、攻击性内容、仇恨言论内容)与含三个仇恨言论子类别的细粒度标注两项评测任务。它针对非英语多模态资源稀缺的问题,旨在捕捉墨西哥西班牙语语境下的语言与文化线索。数据集统计与基线结果均显示该任务本身仍具挑战。
Oracle 云工程集团副总裁 Johnnie Konstantas 表示,agentic AI 让智能体及其子智能体可携带个人权限访问数据、甚至对工作流执行操作,身份控制因此必须尽量统一且无处不在。Oracle 已将 agentic AI 方案集成进安全产品组合,并在最新版 AI 数据库中推出面向 agentic AI 的能力,帮助客户在不牺牲数据安全的前提下推进 AI 创新。
北京大学、百度与清华团队提出 H2S(Highlight-Then-Summarize):先定位问题相关的原文证据,压缩为紧凑摘要再作答。在七任务 H2S-Bench 上,H2S-14B 于 128K 输入、4K 输出预算下平均得分 32.60,超 Qwen3.8-27B 10.17 分。该模型为评测开源模型中最强,4K 输出下保留 16K 预算性能的 97.1%。
MoSAR 把注意力近似视作几何问题,用输入条件的 query/key 路由器在短、中、全局三种模式间混合,学习连续的距离相关注意力场,并可在训练后经 top-1 路由离散化。在 500M 参数匹配模型的预训练实验中,它未降低语言建模质量,困惑度优于 dense RoPE,长度外推下优于 ALiBi 等基线取得最佳困惑度。
一种 Metric-based Loss Weighting 训练方法利用 PCXMI 和 Congruency-based PCXMI 识别受益于图像的 token,在 CoMMuTE 对比数据集上使多模态机器翻译准确率较标准微调最高提升超过 7 个百分点。该方法通过微调三个预训练多模态大语言模型,在三个语言方向的图像引导机器翻译任务上评估,并保持较强通用翻译性能。