更多特征并非更多证据:Jev 在免训练人类活动识别中的局限
免训练的通用概率决策模型 Jev 在 WISDM、UCI341、PAMAP2 上最强表示 macro-F1 仅 0.038、0.118、0.089,远低于监督 HAR 模型的 0.686–0.907。
免训练的通用概率决策模型 Jev 在 WISDM、UCI341、PAMAP2 上最强表示 macro-F1 仅 0.038、0.118、0.089,远低于监督 HAR 模型的 0.686–0.907。
论文提出超球面语义轨迹分析(HSTA),从 arXiv 预印本与 USPTO 专利文本流中无监督追踪技术扩散。基于 30,000 条文档,该方法用 Spherical K-Means 与 UMAP 将 Transformer 句向量投影到单位超球面,定义语义质心漂移与商业化偏移两项指标。
VLA 策略的潜在接口应暴露哪些骨干层仍不清楚,研究在三个预训练模型、LIBERO 与 CALVIN 上比较单层选择与多层融合,54 组配置中 47 组不及最优单层策略。InfoNCE 在四个代理指标中与策略成功率正相关最一致,用它选层比穷举扫描省 9-33 倍 GPU 算力,平均选择遗憾从最深层的 17.89 个百分点降至 3.71 点。
Merlin Plus 提出首个覆盖 9 个器官、由放射科医生创建肿瘤掩码的大规模 CT 数据集,在 Merlin 基础上新增 1,153 个 per-voxel 肿瘤掩码与纵向元数据。掩码由报告驱动的主动学习框架生成:放射学报告识别肿瘤病例并训练分割模型,模型输出初始掩码再由放射科医生审核修正。该数据集支持 CT 中的多器官癌症检测、分割与纵向分析,已公开可获取。
研究用 7 个 LLM、12 种任务设计和 3000 条推文测试标注稳定性,同一模型与任务设计重复运行的一致性较高(Fleiss' κ 中位数 0.91),更换任务设计后下降(Cohen's κ 中位数 0.76)。
基于九场灾害 12,000 条文本的实证研究显示,文本 AI 检测器无法可靠区分人类与 AI 生成的灾害社交媒体帖子。14 组冻结跨模型配置的 AUROC 仅 0.402-0.517,低假阳性工作点下最佳召回率 3.6%。灾害数据训练的线性头虽达 AUROC 0.817,但消除表层差异后降至 0.594,研究认为其不足以作为运营级信任闸门。
SMat-Attention 用行支持集 VC 维为 d 的结构化因果掩码,把 softmax 注意力与线性注意力统一为可调路由,d=1 时退化为标准因果掩码。
PrimeSeeker 提出面向深度搜索智能体的能力导向监督框架,用潜在锚点推理从描述性规格中解析未命名检索锚点,并将锚点迁移到后续信息需求,联合生成问题与参考证据骨架。研究构建了 9,221 条专家轨迹,训练出一个 30B 搜索智能体,在五个深度搜索基准上表现强劲,参考步骤优化进一步提升监督策略。固定预算评估显示其解法覆盖率高,工具调用次数远少于长程系统,检索冗余更低。
StructRL 将长时程视觉-语言-动作(VLA)任务拆解为可验证子任务,仅在前提子任务完成后才给出中间奖励,并按完成速度缩放奖励,从而构建结构化中间监督。在 RoboCasa365 与 LIBERO-Long 上,结合 GR00T-N1.5 和 pi 0.5 的评测中,StructRL 一致优于所对比的在线 RL 基线,表明可验证的结构化中间奖励能改善长时程 VLA 后训练,代码已公开。
研究者对自我发现的 RL 规则 Disco103 做了首次因果机制审计,测试学习历史何时是资产、何时是负担。结果显示,循环历史能把可用奖励尺度窗口维持到六个数量级,而 zero-pinning 下仅三个数量级;不匹配历史的惩罚源自持续钳制,让导入状态自然演化可减轻这一负担。
MATE 是基于强化学习的后训练框架,让统一多模态模型的生成与理解分支轮流充当挑战者与求解者、相互对抗。在 Janus-Pro-1B 上,它使 GenEval 提升 2.4 分、DPG-Bench 提升 1.7 分,九个理解基准平均提升 0.7 分。对抗候选来自模型自身输出,无需单独训练对抗器,落败候选转为下一轮挑战,训练在数据空间形成自博弈。
研究从同一 GPT-2 Small 检查点出发,对标准与对抗式持续训练后的模型做对照比较,发现表征更易被 SAE 分解、任务归因中启用的 SAE 特征更少的鲁棒模型,并未对应更小的忠实电路。
Alignment Forecasting 可在训练前预测微调数据是否让目标模型出现欺骗、谄媚等失准,并输出概率。配套基准 ALIGNMENTFORECASTBENCH 含 5000+ 题,覆盖 17 个目标模型、32 个数据集和 16 种失准模式,前沿模型直接提示表现不佳。
研究显示,正则边界规则使英语维基百科上的最优 token 数增加 28.3%–36.8%,并可用最短路径与线性规划松弛给出可独立校验的下界。Byte pair encoding 比受限下界高 2.1%、比无限制下界高 10.9%;在 85M 非嵌入参数与匹配训练 token 预算下,无限制字典在 12 种语言的配对研究中 held-out bits per byte 更优。
研究构建了含 11,000+ 张标注图像的数据集,覆盖触碰、重叠、完全分离与包含等拓扑关系,并评测 Naive Bayes、KNN、Random Forest、SVM、ANN 与 VGG16、InceptionResNetV2。VGG16 验证准确率达 89.55%,明显领先传统模型,图像特征经分割、轮廓检测与灰度归一化提取。
提出 DASA,用冻结参考模型的激活梯度反馈优化连续合成输入嵌入,无需人类可读文本即可微调 LLM。在 Llama 与 Qwen 家族 6 个 1B–32B 模型、6 个涵盖知识、数学推理、代码生成和常识推理的 benchmark 上,匹配 LoRA 设置下 DASA 性能与原始自然语言数据相当,部分配置更优,多数比较中优于 GRADMM。
HERO 是 ViT-G/14 病理基础模型,用 DINO 与 iBOT 目标训练、以高分辨率 Gram anchoring 精调,语料为约 575,000 张临床全切片图像的 5 亿个 tile。公开基准上,它对中心、扫描仪与染色变化的稳健性优于所对比的 SOTA 基础模型,分类、分割和基因表达预测表现相当,并在 39 个切片级临床任务上平均排名第一。
CoVLM-Bench 是面向车-路配对场景的协同驾驶问答(CDQA)与协同规划(CP)真实世界基准,含 2,196 对帧、35,136 条 CDQA 标注,CP 预测 3 秒时域内的 6 个路点。
数据基础设施工程师 shreya 透露,结构化数据查询工具 Quail 即将推出 AI.CLASSIFY,为 OLAP 场景提供原生 AI 分类算子。她称当下用通用模型 API 做 OLAP 式 AI 数据操作是「一种非常糟糕的方式」,Quail 的价值在于建立在成熟的「向数据提问」UX 与生态之上,而非再做一层模型厂商的 API 包装。
IIT Delhi 团队历时 6 个月在印度打造 4D 城市数字孪生 GeoTwin,已在 Guwahati 市完成原型演示。该系统基于 LiDAR 点云构建 3D 建筑、道路、铁路,可流畅串流 TB 级点云数据,融合 AI 实现街区级内涝、滑坡、违建监测与交通监控、路径优化。4 个月内新增天气监测与预报(复用 Zomato 外卖传感器气象数据)、污染监测、InSAR 地面位移分析和实时交通监控。
arthurcolle 开源了 Graphsub,一个面向 Agent 数据的快速内存图数据库,主张不要把 Agent 数据托付给单一 AI 公司。该讨论由 lux 发起,他指出 Agent 产生的数据应能反哺未来交互,甚至作为训练集,其归属与托管方式成为行业议题。Graphsub 为社区提供了自托管的技术选项。
研究者 rosinality 提出一种更高效的 looped MoE 配置:专家数 2x、循环层数 0.5x、循环次数 2x,并解绑注意力(attention untying)。其核心观点是,经此调整后 looped transformer 的问题从「归纳偏置」转向「如何更好地分配计算资源」,架构设计问题被重新定义为资源分配问题。
Xuanyi Zhou 发布 EasyPPO,通过固定 critic 让 PPO 在 LLM 后训练中稳定运行,实现零训练崩溃。该方法不引入新的 actor loss、也不更换策略算法,并针对 actor 与 critic 交互中的两种失效模式给出修复。在编码任务上,EasyPPO 相对标准 PPO 性能提升 14.89%。
南科大提出 ActFirst-OPD,让智能体先行动、偏离参考轨迹时切回自主预测,解决在线策略蒸馏(OPD)中长推理阻塞环境交互的问题。在 0.6B/1.7B/4B Qwen3 上,ALFWorld 平均提速 2.3 倍、WebShop 1.8 倍、ScienceWorld 4.9 倍。9 组基准-模型设置中 8 组成功率持平或超越 OPD 基线。
美团提出 TGRL(温度分组强化学习),把温度带来的 rollout 多样性转为显式训练信号,解决 RLVR 探索效率瓶颈:每个 prompt 的 rollout 组按温度分为低/高两个子集,用奖励对比估计探索增益,再以 JS 散度分配为 token 级 credit。不扩大 rollout 预算下,达到同等精度最高快 36%,代码已开源。
伯克利团队提出 OmniTaskonomy 统一分类体系,覆盖 19 个 I2I 生成任务与 25 个 I2T 理解能力,并绘制跨任务迁移图谱。在正确训练配方下,I2I 训练可提升下游 I2T 性能且生成数据越多收益越大;迁移呈选择性、任务相关,如深度预测提升度量 3D 推理、物体指向提升计数、拼图重建提升 2D 排序。梯度对齐分析显示两类任务对齐越强,下游迁移收益越大。
新基准 CineSubBench 用 1012 部电影、6 种语言的 813 万条带时间戳字幕,评估 LLM 的长上下文叙事与文化理解。它设 7 项任务,覆盖叙事重建与抽象、类型预测、年龄适宜性及 10 国分级体系。对九个 LLM 的评测显示,情节梗概还原比完整事件概要更可靠,跨语言一致性因模型与语言差异显著,强脏话远比轻度粗俗语更易识别。
一位 Reddit 用户分享角色 LoRA 训练踩坑:此前积累的上百万张孤立角色图被证明不适合训练,正确做法是每套只用少量图,并为角色配上不同场景背景。他基于一手经验判断 AI 分不清 Photoshop 合成的阴影,索性全部不加阴影,结果模型把悬浮当成了角色特征,学到「这个人会悬浮、经常离地面 0.5-3 英寸」。
DynaRobotics 展示了轮式机器人 Taku 的全身控制器(WBC),基于 Isaac Sim 的大规模 GPU 并行强化学习训练,获得针对精确移动操作(loco-manipulation)优化的鲁棒控制器。该控制器面向轮式机器人平台,转发者对其应用于轮式机器人表示兴奋。
DexTaG 是 UMass Amherst 与 Genesis AI 发布的灵巧操作训练管线,用人类演示中的触觉读数作为 RL 奖励引导。动捕手套记录含全手触觉的演示,训练覆盖马克笔、锤子等掌内重定向任务,同一任务下单一 retargeting 策略可泛化到保留轨迹。策略蒸馏为无触觉传感器的学生控制器,可零样本部署到真实机器人。
世界模型创业公司 General Intuition 完成 2.2 亿美元融资,估值 62 亿美元,投资方包括 Valor Equity Partners、Atreides、Seven Seven Six、Point72、Khosla Ventures 和 General Catalyst。
SFTMill 开源,通过 OpenAI 兼容端点对任意现有 LLM 做离策略蒸馏,把行为目标转成完整训练数据集。工作流用 YAML 定义课程表,由 LLM 生成任务,教师模型逐题求解产出覆盖微调目标的问答数据集。作者建议任务生成至少用 Qwen 3.8 27B(medium 档),更弱的模型质量不够。
数学研究者 mathemagic1an 提出一种无需人类偏好数据的 RL 训练思路:让模型只用代码去复现 YouTube 上的讲解视频。复现质量可由视觉模型自动打分验证,成本极低,绕开人工标注,训练出的风格天然接近 YouTube 教育娱乐类内容。他猜测前沿实验室可能已经在跑这个方法的变体。
Anthropic 于 9 月 23 日宣布,其大语言模型 Claude 通过约 950 个并行智能体在 21.5 小时内从基因组数据库中识别出一类与 CRISPR 相似的酶系统,并将其命名为 ART。该系统存在于感染细菌的巨型噬菌体中,相关技术报告尚未经过同行评审。多名基因编辑研究者对其意义持保留态度,指出同一种逆转录酶此前已被发现,它能否成为有用的基因编辑工具仍需实验验证。
约翰霍普金斯大学团队发布 BiomedSQL,首个针对真实生物医学知识库、显式考察科学推理能力的 text-to-SQL 基准,含 68,000 组「问题/SQL/答案」三元组,基于整合基因-疾病关联、组学因果推断与药物审批记录的 BigQuery 知识库。
NVIDIA 发布开源表格预测基础模型 Kumo Tabular,给定带标签的表格行和待预测行,单次前向推理即可返回类别概率或数值预测,无需训练、调参和特征工程。
NVIDIA 发布并开源表格数据基础模型系列 Kumo Tabular,开放权重且可商用,由 Jure Leskovec 团队推出。该模型只需提供带标签的表格数据即可使用,支持分类与回归任务。官方称其在精度与推理时间的权衡上建立了新的 Pareto 前沿。
ChronoGuard 是一款时序泄露审计工具,专抓同一数据泄露换列名后反复出现的问题。它通过特征名归一化与字符串、字符级相似度匹配改名泄露列,例如 chargeback 曾以 cbresolutionflag 混入训练集,改名后再次出现,剔除后 ROC-AUC 从 1.0 回落到 0.826。作者强调记忆只提供线索,判断须依赖时间戳证据。
Sam Witteveen 关于 Jev 论文的分析指出,分类模型在决策场景重新流行,主因是预训练质量提升。该分析认为,基于大模型预训练的模型在决策/分类任务上已具备实用质量,传统 LLM 生成式方案并非唯一选择。
MIT Technology Review 已敲定 2026 年度"值得关注的气候科技公司"名单,将于 10 月 6 日正式发布。名单共 10 家公司,覆盖储能、核能、交通等领域,入选者被认为最有能力真正削减排放或改善公共安全与健康。读者可订阅 The Download 通讯抢先看到该名单。