Hugging Face 如何用 Inference Endpoints、Jobs 和 Buckets 支撑 Papers with Code 搜索
Hugging Face 公开 Papers with Code 的搜索架构,用 PostgreSQL 全文检索加 pgvector 向量检索组成混合检索,由 RRF 融合两路排名。
Hugging Face 公开 Papers with Code 的搜索架构,用 PostgreSQL 全文检索加 pgvector 向量检索组成混合检索,由 RRF 融合两路排名。
约束感知 GPU 分配器让相同硬件与同一批负载下的利用率最多提升 33 个百分点,优先加权产出最多提升 105%。五个竞争场景中,利用率从 52–85% 升至 72–88%,优先加权价值平均提升 52%,最高 105.1%。最强单例是 8 GPU 训练密集型负载,利用率由 53.6% 升至 87.0%,关键在于实时推理按需求曲线分配、批式任务按优先级跨整个调度周期放置。
Meta 公布 WhatsApp 可选功能 Scam Alert 的技术实现,它用端侧机器学习模型在设备本地判断非联系人消息是否为潜在诈骗,消息内容不离开设备也不自动上报。
同一 CodeAct 智能体在 AppWorld Test Challenge 的 417 个任务上,Claude Sonnet 4.6 共花费 $79,GPT-4.1 则为 $155,尽管后者 token 定价更低。
Hugging Face 博客发布 PyTorch 性能分析系列第三部分,用 profiler 轨迹逐一对比朴素 attention、in-place 掩码以及 SDPA 的 math、efficient、flash 和 cuDNN 四种后端实现。
推荐理由:逐层对比四种 attention 后端的 profiler 轨迹,提供先做预期再验证这一可迁移的性能排查方法。
PRX 系列第 4 篇披露其数据策略:预训练语料由公开与内部数据集混合构建,图像经 VLM 重新生成描述,供 7B 模型预训练使用。文本编码器从 T5Gemma 换成 Qwen3-VL 后改为训练中实时计算 text latents,吞吐损失约 3–4%,30 天训练约多 1 天。数据以 Lance 构建、MDS 流式训练,图像统一编码为 JPEG quality 92。
Google DeepMind 的 Co-Scientist 帮助 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室寻找逆转细胞衰老的候选基因,扫描数万篇论文后提出 20 多个可测试的新基因因子。
剑桥大学教授 Clare Bryant 用 Co-Scientist 筛查病原体跨物种传播引发脓毒症等重症的分子开关,该工具生成并排序假设,并优先给出一个她此前未关注的蛋白。她随后在 Co-Scientist 内加入未公开的保密材料,假设从候选蛋白细化到具体氨基酸,团队正构建含氨基酸突变的细胞系做验证。这类工作原本需两到三年实验,她预计若靶点正确可在六个月内完成。
Google DeepMind 的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度为 80%,三天前升至接近 100%,这也是首次从一级风速起步成功预测风暴增强到五级。
推荐理由:原文以飓风 Melissa 为例,交代 AI 天气模型在快速增强预报上的实际表现,以及传统模型在路径与强度间的取舍。
Mistral 基于其开源编码助手 Vibe 构建了一个自动为 Rails 代码库生成和改进 RSpec 测试的智能体,可在 CI/CD 中无人干预运行。该智能体依靠仓库级 AGENTS.md 执行计划、按文件类型拆分的 Skills 文件,以及 RuboCop 与 SimpleCov 自定义工具完成生成、校验和自校正。
Mistral AI 团队复盘了 vLLM 中的一次内存泄漏排查。在他们用 Mistral Medium 3.1 做 P/D 分离部署并启用图编译时,系统内存以每分钟 400 MB 线性增长,数小时后会进入 OOM 状态。
Mistral 用 LoRA 微调 Pixtral-12B,在 Aerial Image Dataset(AID)卫星图像分类任务上较基础模型取得显著提升。实验使用 8,000 条训练样本与 2,000 条测试样本,未微调的 Pixtral-12B 会把 Playground 误判为 Stadium,还会幻觉出不存在的类别名。
Mistral 展示用 LLM as a Judge 评估 RAG:由 judge LLM 按数值或定性量表为 generator LLM 的答案打分。评判采用 TruLens 的 RAG Triad 三项指标,并通过 Mistral API 近期上线的结构化输出,按自定义 schema 返回可机读的评分与解释。
Mistral AI 的 TranscriptToPRDTicket 智能体工作流由 Mistral Large 2 驱动,可把会议转录自动生成 PRD 和开发工单,并写入 Linear、Jira 等项目管理工具。
TensorFlow 博客发文介绍开源教材 MLSysBook.AI,把机器学习系统工程的五个环节与 TensorFlow 生态工具逐一对齐。
Spotify 基于 TF-Agents Environment 原语构建离线模拟器,用 Keras 训练的用户模型预测用户对推荐曲目的反应。团队训练并评估了顺序推荐模型、PPG、DQN 和改进的 Action-Head DQN(AH-DQN),以应对大状态与动作空间。线上实验显示离线性能估计与线上结果强相关。
借助 TensorFlow Lite 的 Flutter 插件,此前用 TensorFlow 训练并转为 TFLite 的强化学习棋盘游戏 Plane Strike 被移植到 Flutter,可在 Android 和 iOS 上运行。
由 Google 与 Tryolabs 合作开发的开源 Python 库 Temporian 面向机器学习时序数据,用于预处理与特征工程。文章以虚构网店的 sales.csv 交易记录为例,用 EventSet 容器及 moving_sum、add_index 算子计算 7 天滚动销售额,再用 TensorFlow Decision Forests 训练周销售额预测模型。
TensorFlow 团队用 Simpleperf 剖析并优化 TFLite 内存 arena 的初始化过程,tensor 分配开销从运行时占比 49.9% 降到 11%,示例模型运行时缩短 25%。
Google 用 PaLM API 演示了 LLM 增强推荐系统的四条路径:对话式、序列、评分预测与嵌入向量推荐。对话式和序列推荐分别调用 PaLM API 的 Chat 与 Text 服务,评分预测则用 Text 服务为候选电影打分排序。
TensorFlow 发布新教程,演示如何用 dtreeviz 可视化并解释 TensorFlow Decision Forests 的决策树。教程以 Penguin、Abalone 数据集为例,展示每个决策节点如何切分特征域、叶子节点的样本分布,以及单个测试样本从根到叶的预测路径。dtreeviz 于 2018 年首次发布,是目前最流行的决策树可视化库。