跳到正文

#数据/训练

今日 76 条
9月29日周二
  1. Wired AI53

    Timnit Gebru 认为 AI 不存在存在性威胁

    在 Wired 的访谈中,AI 研究者 Timnit Gebru 表示 AI 并不构成存在性威胁,认为这一叙事不只是分心,而且有害。她把这种叙事追溯到资助 Anthropic 早期融资并资助 METR 等机构的人群,称其为监管俘获的一部分,并援引 Lina Khan 提出的欺骗性营销、数据透明度与数据工人劳动剥削等现有法律本该管辖的事项。

  2. AGI Hunt33

    澳洲数据黑客事件曝光:OpenAI、Anthropic 等 AI 公司数据招募的新攻击面与社会风险

    澳大利亚一起数据黑客事件曝光,英国媒体 inews 称其揭示了 AI 时代一个日益增长的社会风险,报道指向 OpenAI、Anthropic 等公司与 AI 训练数据相关的问题。相关帖子仅给出原文链接、未摘录正文,具体攻击手法、涉及数据规模与影响范围需阅读原文了解。

  3. arXiv cs.AI35

    SCALPEL:基于对比稀疏自编码器的选择性表征层机器遗忘

    SCALPEL 是一种对比式稀疏自编码器,用于表征层的选择性机器遗忘,可缓解重建式提取偏向背景结构、忽略低能量目标成分的能量偏置。在 TOFU 上对 Qwen、Llama、Gemma 的实验中,它优于 NMF 和标准 SAE 干预,与 Gradient Difference、RMU 相当。理论分析显示,对比训练能促进目标选择性特征,其选择分数可控制背景知识扰动的期望。

  4. arXiv cs.AI40

    Self-Play Search Distillation:用自对弈搜索蒸馏提升 LLM 推理能力

    Self-Play Search Distillation(SPSD)通过棋盘游戏自对弈中的 MuZero 类网络搜索生成超人类合成数据,并把搜索记录转成思维链,为大语言模型提供环境接地监督。在 Qwen3-4B-Base 上,六个数学基准的平均分从 24.1 升至 36.6,未见过的游戏胜率从 15% 升至 45%。该方法仅用自对弈搜索记录训练,即可迁移到数学推理。

  5. arXiv cs.AI31

    Acacia:在 Web 图上从零训练的图基础模型

    图基础模型 Acacia 仅用 Common Crawl Web 图从零训练,不依赖预训练 LLM,也无需额外训练即可适配新的图和标签。它支持节点分类、链接预测、节点聚类和图生成等任务,并具备上下文学习能力。该结果提供了图模型也能像 LLM 一样从零训练获得涌现能力的证据。

  6. arXiv cs.AI40

    EXAONE Demand 1.0:面向需求预测的时间序列基础模型

    EXAONE Demand 1.0 是面向需求预测的时间序列基础模型,基于 11.3M 条序列、48.4B 观测值和 73 个来源构建需求专用语料。模型在冻结骨干网络上为平滑、间歇、波动、块状四类需求各附加低秩分支,由 router 读取 8 个无量纲统计量分配权重。在 22 个留出数据集上,其真实+合成数据版与纯合成数据版均优于 36 个 TSFM。

  7. arXiv cs.AI33

    TISD:带轨迹干预的在线策略自蒸馏

    TISD 提出一种分支-重生成-蒸馏算法:强制教师选择的轨迹分支动作,由学生生成后续后缀,再用特权上下文条件教师蒸馏完整轨迹。在编码模型上,TISD 较 SDPO 将平均 Avg@4 提升 1.2 个百分点;在科学领域,等步数预算下平均 Avg@128 提升 0.8 分,等时间预算下提升 0.3 分。这些结果支持教师引导的分支可作为暴露有用后继上下文的自蒸馏方式。

  8. AGI Hunt33

    arXiv 综述:推荐系统离线评估的数据处理实践混乱不一

    arXiv 论文 2609.31696 由 Alberto Mancino 等 8 位作者综述推荐系统离线评估的数据处理流程,覆盖数据集选择到训练/验证/测试划分的完整流水线。综述跨越协同过滤、序列、图、多模态、联邦与 LLM 推荐等范式,发现训练前数据处理决策影响算法可得信息、实验可比性与可复现性,但长期缺乏审视、实践高度不一致,并提出统一框架与分类法。

  9. AGI Hunt39

    Dr. Free 抛弃难度奖励,用证据增益训练自进化搜索智能体

    Dr. Free 提出首个不依赖难度奖励的自进化搜索智能体训练框架:从知识图谱采样关系链并配对相关段落,为题目赋予多跳结构,只有完整证据段落下答案的似然超过所有捷径上下文的最大似然时,题目才获得正的信息增益奖励。该奖励基于 teacher-forced 似然计算,免去 pass-rate 估计,大幅缩短 proposer 训练时间。

  10. AGI Hunt27

    X 用户 xeophon 质疑「开源模型靠对抗性蒸馏获得能力」论调难自洽

    X 用户 xeophon 质疑「开源模型能力主要靠对抗性蒸馏获得」的说法:若该论断成立,开源模型为何表现能超过闭源模型,且拒绝率更低甚至没有?他补充称自己曾直播强化学习运行过程、开源了部分环境,仍有人不相信其结果,暗示相关能力来源争议更多是立场问题而非证据问题。

  11. IT之家28

    《气象数据管理办法》11 月 1 日起实施,公共气象数据确权、授权运营有法可依

    中国气象局9月29日发布《气象数据管理办法》,自11月1日起实施。该办法建立公共气象数据授权运营机制,为公共气象数据确权、授权运营提供明确法规依据,填补制度空白。同时确立数据流通监管平台、各环节安全主体责任、重要数据目录、数据出境与安全评估等制度,并鼓励面向人工智能、大数据开展气象数据开发利用技术与高质量数据集建设。

  12. AGI Hunt14

    Reddit 讨论:Softmax 输出仅 N-1 自由度,能否少一层参数?

    Reddit 用户提出一种架构思路:softmax 输出受「和为 1」约束、实际只有 N-1 个自由度,可假设 logits 之和为零,让最后一个 logit 由其余 logits 的负和推出,用 N-1 个输入替代 N 个,从而减少最后一层参数或略微加快收敛。发帖人承认该收益在几乎所有场景下都可忽略,并询问是否存在不做它的理论理由。

  13. AGI Hunt32

    Uber Eats 排序模型每秒 800 万次预测,工程团队公开特征一致性方案

    Uber 工程团队公开特征一致性框架 feature logging,解决训练与推理特征不一致问题:生产环境特征值可能因来源、格式(如 en vs en-US)或计算逻辑差异而与训练数据偏离。该框架从在线推理管道直接产出训练数据,形成训练数据飞轮,在线特征含 userid、语言、餐厅元数据及预计算的历史点击/下单行为特征。Uber Eats 排序模型每秒服务约 800 万次预测。

  14. Google Developers Blog46

    用深度学习和 Keras 解码宇宙信号

    深度学习和 Keras 正被用于解码天体粒子物理的宇宙信号,宇宙线、伽马射线和中微子由跨数千平方公里的观测站以纳秒分辨率记录成波形。Pierre Auger Observatory 的 1500 多个探测器站覆盖 3000 km²,IceCube 用约 1 km³ 南极冰探测中微子。10¹⁹ eV 以上粒子通量仅每平方公里每世纪约 100 个,深度学习可提升仪器灵敏度并发现隐藏模式。

  15. AGI Hunt30

    采样 softmax 为何把训练提速 1.7 倍:@tokenbender 拆解其偏差代价

    @tokenbender 拆解了采样 softmax 把训练从 67s 提速到 39.9s(1.7 倍)的原理与偏差代价。LM head 对 5 万个 logits 的交叉熵每步吃掉相当大比例算力,而按 Zipf 分布概率质量集中在几千个 logits 上,无需对全部 logits 计算,几乎不损失精度。代价是自归一化带来严重偏差,系统性欠训练尾部 logits。

  16. IT之家29

    LG Innotek 将用自动驾驶汽车为自动驾驶传感系统开发收集数据

    LG Innotek 宣布与自动驾驶软件企业 Applied Intuition 合作,在韩国境内部署自动驾驶传感数据采集车辆。其计划以首尔、仁川、京畿道为中心运营车队,到 2028 年部署 20 辆数据采集车和自动驾驶软件开发车,并投放美国、欧洲、日本。车辆搭载摄像头、雷达、激光雷达,采集数据将结合数字孪生环境提升传感器性能、验证系统有效性。

  17. arXiv cs.CL24

    MexHat:面向墨西哥西班牙语视频的仇恨言论检测数据集

    MexHat 是一个面向墨西哥西班牙语视频的仇恨言论检测数据集,包含约 1k 个视频片段,设有三分类(无负面内容、攻击性内容、仇恨言论内容)与含三个仇恨言论子类别的细粒度标注两项评测任务。它针对非英语多模态资源稀缺的问题,旨在捕捉墨西哥西班牙语语境下的语言与文化线索。数据集统计与基线结果均显示该任务本身仍具挑战。

  18. SiliconANGLE:AI27

    Agentic AI 给身份与数据库安全带来新压力,Oracle 谈应对之策

    Oracle 云工程集团副总裁 Johnnie Konstantas 表示,agentic AI 让智能体及其子智能体可携带个人权限访问数据、甚至对工作流执行操作,身份控制因此必须尽量统一且无处不在。Oracle 已将 agentic AI 方案集成进安全产品组合,并在最新版 AI 数据库中推出面向 agentic AI 的能力,帮助客户在不牺牲数据安全的前提下推进 AI 创新。

  19. arXiv cs.CL35

    MoSAR:学习自适应且可近似注意力几何的语义注意力模式混合

    MoSAR 把注意力近似视作几何问题,用输入条件的 query/key 路由器在短、中、全局三种模式间混合,学习连续的距离相关注意力场,并可在训练后经 top-1 路由离散化。在 500M 参数匹配模型的预训练实验中,它未降低语言建模质量,困惑度优于 dense RoPE,长度外推下优于 ALiBi 等基线取得最佳困惑度。

  20. arXiv cs.CL36

    基于指标损失加权提升 LLM 多模态机器翻译视觉敏感性

    一种 Metric-based Loss Weighting 训练方法利用 PCXMI 和 Congruency-based PCXMI 识别受益于图像的 token,在 CoMMuTE 对比数据集上使多模态机器翻译准确率较标准微调最高提升超过 7 个百分点。该方法通过微调三个预训练多模态大语言模型,在三个语言方向的图像引导机器翻译任务上评估,并保持较强通用翻译性能。