跳到正文

#数据/训练

今日 76 条
今天9月30日周三
  1. arXiv cs.AI37

    VLA 的层之谜:VLA 潜在接口的信息论分析

    VLA 策略的潜在接口应暴露哪些骨干层仍不清楚,研究在三个预训练模型、LIBERO 与 CALVIN 上比较单层选择与多层融合,54 组配置中 47 组不及最优单层策略。InfoNCE 在四个代理指标中与策略成功率正相关最一致,用它选层比穷举扫描省 9-33 倍 GPU 算力,平均选择遗憾从最深层的 17.89 个百分点降至 3.71 点。

  2. arXiv cs.CV38

    Merlin Plus:大规模、多癌种、图像-掩码-报告 CT 数据集

    Merlin Plus 提出首个覆盖 9 个器官、由放射科医生创建肿瘤掩码的大规模 CT 数据集,在 Merlin 基础上新增 1,153 个 per-voxel 肿瘤掩码与纵向元数据。掩码由报告驱动的主动学习框架生成:放射学报告识别肿瘤病例并训练分割模型,模型输出初始掩码再由放射科医生审核修正。该数据集支持 CT 中的多器官癌症检测、分割与纵向分析,已公开可获取。

  3. arXiv cs.CL45

    我们还能信任灾害社交媒体感知吗?检测 AI 生成社交媒体帖子的实证研究

    基于九场灾害 12,000 条文本的实证研究显示,文本 AI 检测器无法可靠区分人类与 AI 生成的灾害社交媒体帖子。14 组冻结跨模型配置的 AUROC 仅 0.402-0.517,低假阳性工作点下最佳召回率 3.6%。灾害数据训练的线性头虽达 AUROC 0.817,但消除表层差异后降至 0.594,研究认为其不足以作为运营级信任闸门。

  4. arXiv cs.CL31

    PrimeSeeker:面向深度搜索智能体的能力导向监督

    PrimeSeeker 提出面向深度搜索智能体的能力导向监督框架,用潜在锚点推理从描述性规格中解析未命名检索锚点,并将锚点迁移到后续信息需求,联合生成问题与参考证据骨架。研究构建了 9,221 条专家轨迹,训练出一个 30B 搜索智能体,在五个深度搜索基准上表现强劲,参考步骤优化进一步提升监督策略。固定预算评估显示其解法覆盖率高,工具调用次数远少于长程系统,检索冗余更低。

  5. arXiv cs.CV37

    StructRL:面向长时程视觉-语言-动作任务的在线结构化强化学习

    StructRL 将长时程视觉-语言-动作(VLA)任务拆解为可验证子任务,仅在前提子任务完成后才给出中间奖励,并按完成速度缩放奖励,从而构建结构化中间监督。在 RoboCasa365 与 LIBERO-Long 上,结合 GR00T-N1.5 和 pi 0.5 的评测中,StructRL 一致优于所对比的在线 RL 基线,表明可验证的结构化中间奖励能改善长时程 VLA 后训练,代码已公开。

  6. arXiv cs.CV33

    MATE:面向统一多模态模型的互对抗自训练与演化数据框架

    MATE 是基于强化学习的后训练框架,让统一多模态模型的生成与理解分支轮流充当挑战者与求解者、相互对抗。在 Janus-Pro-1B 上,它使 GenEval 提升 2.4 分、DPG-Bench 提升 1.7 分,九个理解基准平均提升 0.7 分。对抗候选来自模型自身输出,无需单独训练对抗器,落败候选转为下一轮挑战,训练在数据空间形成自博弈。

  7. arXiv cs.AI37

    Token 边界的代价:压缩证书与预测

    研究显示,正则边界规则使英语维基百科上的最优 token 数增加 28.3%–36.8%,并可用最短路径与线性规划松弛给出可独立校验的下界。Byte pair encoding 比受限下界高 2.1%、比无限制下界高 10.9%;在 85M 非嵌入参数与匹配训练 token 预算下,无限制字典在 12 种语言的配对研究中 held-out bits per byte 更优。

  8. arXiv cs.AI40

    人类可读文本对 LLM 微调是必要的吗?

    提出 DASA,用冻结参考模型的激活梯度反馈优化连续合成输入嵌入,无需人类可读文本即可微调 LLM。在 Llama 与 Qwen 家族 6 个 1B–32B 模型、6 个涵盖知识、数学推理、代码生成和常识推理的 benchmark 上,匹配 LoRA 设置下 DASA 性能与原始自然语言数据相当,部分配置更优,多数比较中优于 GRADMM。

  9. arXiv cs.CV42

    HERO:面向肿瘤学稳健表示的组织学编码器

    HERO 是 ViT-G/14 病理基础模型,用 DINO 与 iBOT 目标训练、以高分辨率 Gram anchoring 精调,语料为约 575,000 张临床全切片图像的 5 亿个 tile。公开基准上,它对中心、扫描仪与染色变化的稳健性优于所对比的 SOTA 基础模型,分类、分割和基因表达预测表现相当,并在 39 个切片级临床任务上平均排名第一。

  10. AGI Hunt21

    sh_reya 预告:Quail 即将上线 AI.CLASSIFY,重构 OLAP 数据查询体验

    数据基础设施工程师 shreya 透露,结构化数据查询工具 Quail 即将推出 AI.CLASSIFY,为 OLAP 场景提供原生 AI 分类算子。她称当下用通用模型 API 做 OLAP 式 AI 数据操作是「一种非常糟糕的方式」,Quail 的价值在于建立在成熟的「向数据提问」UX 与生态之上,而非再做一层模型厂商的 API 包装。

  11. AGI Hunt33

    印度团队 6 个月造出城市 4D 数字孪生 GeoTwin,整合洪水交通污染监测

    IIT Delhi 团队历时 6 个月在印度打造 4D 城市数字孪生 GeoTwin,已在 Guwahati 市完成原型演示。该系统基于 LiDAR 点云构建 3D 建筑、道路、铁路,可流畅串流 TB 级点云数据,融合 AI 实现街区级内涝、滑坡、违建监测与交通监控、路径优化。4 个月内新增天气监测与预报(复用 Zomato 外卖传感器气象数据)、污染监测、InSAR 地面位移分析和实时交通监控。

  12. AGI Hunt30

    rosinality 提出新 looped MoE 配置:2 倍专家、0.5 倍循环层、2 倍循环并解绑注意力

    研究者 rosinality 提出一种更高效的 looped MoE 配置:专家数 2x、循环层数 0.5x、循环次数 2x,并解绑注意力(attention untying)。其核心观点是,经此调整后 looped transformer 的问题从「归纳偏置」转向「如何更好地分配计算资源」,架构设计问题被重新定义为资源分配问题。

  13. AGI Hunt46

    南科大提出 ActFirst-OPD:先行动后思考,多轮智能体蒸馏训练提速最高 4.9 倍

    南科大提出 ActFirst-OPD,让智能体先行动、偏离参考轨迹时切回自主预测,解决在线策略蒸馏(OPD)中长推理阻塞环境交互的问题。在 0.6B/1.7B/4B Qwen3 上,ALFWorld 平均提速 2.3 倍、WebShop 1.8 倍、ScienceWorld 4.9 倍。9 组基准-模型设置中 8 组成功率持平或超越 OPD 基线。

  14. AGI Hunt44

    美团 TGRL:温度分组强化学习,RLVR 训练速度提升最高 36%

    美团提出 TGRL(温度分组强化学习),把温度带来的 rollout 多样性转为显式训练信号,解决 RLVR 探索效率瓶颈:每个 prompt 的 rollout 组按温度分为低/高两个子集,用奖励对比估计探索增益,再以 JS 散度分配为 token 级 credit。不扩大 rollout 预算下,达到同等精度最高快 36%,代码已开源。

  15. AGI Hunt41

    伯克利 OmniTaskonomy:19 类图像生成任务如何反哺 25 项视觉理解

    伯克利团队提出 OmniTaskonomy 统一分类体系,覆盖 19 个 I2I 生成任务与 25 个 I2T 理解能力,并绘制跨任务迁移图谱。在正确训练配方下,I2I 训练可提升下游 I2T 性能且生成数据越多收益越大;迁移呈选择性、任务相关,如深度预测提升度量 3D 推理、物体指向提升计数、拼图重建提升 2D 排序。梯度对齐分析显示两类任务对齐越强,下游迁移收益越大。

  16. AGI Hunt30

    CineSubBench:用 1012 部电影字幕考 LLM 长叙事与文化理解

    新基准 CineSubBench 用 1012 部电影、6 种语言的 813 万条带时间戳字幕,评估 LLM 的长上下文叙事与文化理解。它设 7 项任务,覆盖叙事重建与抽象、类型预测、年龄适宜性及 10 国分级体系。对九个 LLM 的评测显示,情节梗概还原比完整事件概要更可靠,跨语言一致性因模型与语言差异显著,强脏话远比轻度粗俗语更易识别。

  17. AGI Hunt52

    去掉阴影背景后角色 LoRA 学会悬浮:数据集踩坑实录

    一位 Reddit 用户分享角色 LoRA 训练踩坑:此前积累的上百万张孤立角色图被证明不适合训练,正确做法是每套只用少量图,并为角色配上不同场景背景。他基于一手经验判断 AI 分不清 Photoshop 合成的阴影,索性全部不加阴影,结果模型把悬浮当成了角色特征,学到「这个人会悬浮、经常离地面 0.5-3 英寸」。

  18. AGI Hunt38

    DexTaG:用人类触觉示教引导 RL,机器人学人类式用工具

    DexTaG 是 UMass Amherst 与 Genesis AI 发布的灵巧操作训练管线,用人类演示中的触觉读数作为 RL 奖励引导。动捕手套记录含全手触觉的演示,训练覆盖马克笔、锤子等掌内重定向任务,同一任务下单一 retargeting 策略可泛化到保留轨迹。策略蒸馏为无触觉传感器的学生控制器,可零样本部署到真实机器人。

  19. AGI Hunt38

    研究者 mathemagic1an 提出免人类偏好的 RL 思路:用代码复现 YouTube 讲解视频

    数学研究者 mathemagic1an 提出一种无需人类偏好数据的 RL 训练思路:让模型只用代码去复现 YouTube 上的讲解视频。复现质量可由视觉模型自动打分验证,成本极低,绕开人工标注,训练出的风格天然接近 YouTube 教育娱乐类内容。他猜测前沿实验室可能已经在跑这个方法的变体。

  20. Wired AI65

    Anthropic 称 Claude 发现类 CRISPR 酶系统,专家质疑其意义

    Anthropic 于 9 月 23 日宣布,其大语言模型 Claude 通过约 950 个并行智能体在 21.5 小时内从基因组数据库中识别出一类与 CRISPR 相似的酶系统,并将其命名为 ART。该系统存在于感染细菌的巨型噬菌体中,相关技术报告尚未经过同行评审。多名基因编辑研究者对其意义持保留态度,指出同一种逆转录酶此前已被发现,它能否成为有用的基因编辑工具仍需实验验证。

9月29日周二
  1. AGI Hunt43

    ChronoGuard:捕捉换列名重犯的时序泄露审计工具

    ChronoGuard 是一款时序泄露审计工具,专抓同一数据泄露换列名后反复出现的问题。它通过特征名归一化与字符串、字符级相似度匹配改名泄露列,例如 chargeback 曾以 cbresolutionflag 混入训练集,改名后再次出现,剔除后 ROC-AUC 从 1.0 回落到 0.826。作者强调记忆只提供线索,判断须依赖时间戳证据。