跳到正文

#数据/训练

今日 76 条
6月26日周五
6月20日周六
  1. Dwarkesh Patel:Podcast & Blog57

    Dwarkesh 分析 AI 的数据黑洞与人类样本效率差距

    Dwarkesh Patel 在博客文章中提出,近年 AI 能力的提升主要来自数据规模和算力的扩大,而不是训练样本效率的进步。他给出对比称,前沿模型训练使用 10 万亿到 100 万亿 token,而人类从出生到成年约见 2 亿 token,差距接近百万倍;即便参数量无限增加,所需数据也只减少约 10 倍。

6月11日周四
6月8日周一
6月5日周五
  1. Google Research62

    Google 提出 PHRM 系统,用手机前置摄像头被动监测心率与静息心率

    Google Research 在 Nature 发表研究,提出 PHRM 系统,可在日常使用手机时后台监测心率(HR)与静息心率(RHR)。该系统利用前置摄像头在面部解锁后的数秒内拍摄视频,通过端侧深度学习估计心率,与 ECG 相比 MAPE 低于 10%,符合所有肤色人群的行业精度标准,日 RHR 与 Fitbit Charge 6 相比 MAE 为 4.39 bpm。

    推荐理由:论文公开了 PHRM 的跨肤色误差数据与大样本数据集规模,读者可对照可穿戴设备理解被动健康监测的量化标准。

6月4日周四
5月28日周四
5月27日周三
  1. Mistral AI44

    Mistral 的 Physics AI 研究:正在塑造产业的突破

    Mistral 收购 Emmi AI,加码面向航空航天、汽车、半导体和能源等行业的 Physics AI 基础模型研究。其已发布突破包括 AB-UPT,可在单块 GPU 上处理 9M 表面和 140M 体积网格单元、无需重新网格化的空气动力学 CFD 模型。NeuralDEM 则是首个面向大规模多物理过程的端到端深度学习代理模型,可实时仿真流化床反应器等工业过程。

5月18日周一
4月22日周三
4月16日周四
  1. Google Research46

    Google Research 提出 MoGen:用 AI 合成神经元加速大脑图谱绘制

    Google Research 用合成神经元形状增强 PATHFINDER 训练数据,将小鼠轴突重建误差降低 4.4%。其 MoGen 模型基于 PointInfinity 点云流匹配,用 1,795 个小鼠皮层轴突训练,训练数据加入 10% 合成形状即可减少合并错误。MoGen 已开源,论文将在 ICLR 2026 发表;按完整小鼠脑规模计算,相当于节省 157 人年人工校对。

4月9日周四
4月1日周三
  1. Google Research45

    Google Research:构建更好的 AI 基准,多少名标注者才够?

    Google Research 的“Forest vs Tree”研究指出,AI 评测常用的每项 1–5 名标注者标准不足,往往需要超过 10 名标注者。基于 Toxicity 等数据集的模拟显示,最优配比取决于指标:多数投票准确率偏向增加条目,捕捉意见分布则需增加标注者;约 1,000 条总标注即可实现高可复现性,模拟器已在 GitHub 开源。

3月25日周三
  1. Google Research42

    Google Research 的 S2Vec 如何学习城市语言,映射现代世界

    Google Research 提出自监督框架 S2Vec,用 S2 Geometry 分区加特征栅格化把建成环境转为多层图像,再以掩码自编码(MAE)学习通用嵌入向量。在社会经济预测中,S2Vec 在零样本地理外推任务(如 US-wide 人口密度、收入中位数)上常为最佳单一模型,与图像嵌入做多模态融合后优于单模态。树覆盖、海拔等环境任务仍有待改进。

3月18日周三
  1. Mistral AI44

    Mistral AI 推出 Forge:为企业构建基于自有知识的前沿级模型

    Mistral AI 推出 Forge,一套让企业用自有专有知识训练前沿级模型的系统,覆盖预训练、后训练与强化学习,支持稠密与 MoE 架构。Forge 按 agent 优先设计,Mistral Vibe 等智能体可用自然语言完成微调、超参数搜索与数据合成。合作方包括 ASML、Ericsson、欧洲空间局、新加坡 HTX 与 Reply。

3月17日周二
3月12日周四
3月7日周六
  1. Google Research53

    Google Research 发布 WAXAL 数据集,开放 27 种非洲语言语音资源

    Google Research 发布 WAXAL 开放语音数据集,覆盖 27 种撒哈拉以南非洲语言,面向超 1 亿使用者,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时转写自然语音的 ASR 数据和超 565 小时高保真录音的 TTS 数据。采集工作自 2021 年起由非洲高校与社区组织主导、Google 提供方法指导,Google 表示将继续扩充语种。

11月1日周六
  1. BAIR:Berkeley AI Research Blog47

    BAIR:不依赖 TD 学习的 RL,分治法价值学习

    BAIR 博文提出一种基于分治法的 RL 算法,不依赖 TD 学习做价值学习,理论上把 Bellman 递归次数从线性降到对数,从而扩展到长时序任务。在一项与 Aditya 共同主导的工作中,该方法已用于 goal-conditioned RL,作者称这是首个把分治价值学习规模化的工作。但如何选取最优子目标 w 仍不清楚。

9月1日周一
  1. BAIR:Berkeley AI Research Blog44

    word2vec 究竟学到了什么?

    word2vec 的学习过程被证明在实际条件下可约简为无权重最小二乘矩阵分解,最终表示等价于 PCA。从接近零初始化训练时,它按离散步骤依次学习正交线性子空间,每步提升嵌入矩阵秩并阶梯式降低损失。这些特征可闭式算作矩阵 M* 的前几个特征向量,按 Wikipedia 统计前几项对应名人传记、政府市政与地理制图等概念。

8月1日周五
12月6日周五
2月7日周三
10月20日周五
9月12日周二
8月25日周五
6月7日周三
  1. TensorFlow Blog40

    如何用 dtreeviz 可视化并解释 TensorFlow 决策树

    TensorFlow 发布新教程,演示如何用 dtreeviz 可视化并解释 TensorFlow Decision Forests 的决策树。教程以 Penguin、Abalone 数据集为例,展示每个决策节点如何切分特征域、叶子节点的样本分布,以及单个测试样本从根到叶的预测路径。dtreeviz 于 2018 年首次发布,是目前最流行的决策树可视化库。