BAIR:不依赖 TD 学习的 RL,分治法价值学习
BAIR 博文提出一种基于分治法的 RL 算法,不依赖 TD 学习做价值学习,理论上把 Bellman 递归次数从线性降到对数,从而扩展到长时序任务。在一项与 Aditya 共同主导的工作中,该方法已用于 goal-conditioned RL,作者称这是首个把分治价值学习规模化的工作。但如何选取最优子目标 w 仍不清楚。
BAIR 博文提出一种基于分治法的 RL 算法,不依赖 TD 学习做价值学习,理论上把 Bellman 递归次数从线性降到对数,从而扩展到长时序任务。在一项与 Aditya 共同主导的工作中,该方法已用于 goal-conditioned RL,作者称这是首个把分治价值学习规模化的工作。但如何选取最优子目标 w 仍不清楚。
Mistral AI 发布 Mistral AI Studio,一个由 Observability、Agent Runtime 和 AI Registry 三大支柱组成的生产级 AI 平台。
Mistral AI 宣布完成 1.7B€ 的 C 轮融资,投后估值 11.7B€,由半导体设备厂商 ASML Holding NV 领投。现有投资方 DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 参投。
推荐理由:Mistral AI 完成 1.7B€ C 轮融资并获 ASML 领投,读者可据此了解前沿模型公司与半导体产业的绑定方式。
Mistral 为 Le Chat 推出 Memories(beta)记忆功能,会自动保存有用信息,并在调用时给出指向来源的链接。用户可以随时关闭记忆、开启不使用记忆的隐身对话、编辑或删除单条记忆,还能导出和从别处导入记忆数据。官方同时上线 Memory Insights 提示词,帮助用户查看 Le Chat 记住了什么,并称后续将支持按类别整理记忆和查看记忆何时被使用。
Mistral AI 在 Le Chat 上线 20 多个基于 MCP 的安全连接器(beta)和 Memories(beta),免费版用户即可使用,还能接入目录之外的任意远程 MCP 服务器。
word2vec 的学习过程被证明在实际条件下可约简为无权重最小二乘矩阵分解,最终表示等价于 PCA。从接近零初始化训练时,它按离散步骤依次学习正交线性子空间,每步提升嵌入矩阵秩并阶梯式降低损失。这些特征可闭式算作矩阵 M* 的前几个特征向量,按 Wikipedia 统计前几项对应名人传记、政府市政与地理制图等概念。
TensorFlow 2.20 发布,tf.lite 模块将弃用,端侧推理开发迁移至独立仓库 LiteRT,新 API 提供 Kotlin 和 C++ 版本。LiteRT 面向 NPU 和 GPU 硬件加速,为 NPU 提供统一接口,并通过零拷贝硬件缓冲减少内存拷贝。
Mistral 用 LoRA 微调 Pixtral-12B,在 Aerial Image Dataset(AID)卫星图像分类任务上较基础模型取得显著提升。实验使用 8,000 条训练样本与 2,000 条测试样本,未微调的 Pixtral-12B 会把 Playground 误判为 Stadium,还会幻觉出不存在的类别名。
Mistral 发布 Codestral 25.08 及配套企业编码栈,涵盖补全、语义检索、智能体工作流和 Mistral Code IDE 插件,今日起可用于企业部署。
Mistral AI 发布 LLM 全生命周期环境足迹研究,与 Carbone 4、法国生态转型署 ADEME 合作完成,并由 Resilio 和 Hubblo 复核。
推荐理由:Mistral 公布模型训练与推理的环境足迹核算口径及具体数据,可供评估 AI 环境影响时对照参考。
Mistral 为 Le Chat 推出一批新功能,包括 Deep Research(预览)、语音模式、原生多语言推理、Projects 和图像编辑。Deep Research 由工具增强的研究 agent 驱动,可产出带引用的结构化报告;语音模式基于新语音模型 Voxtral,推理能力来自 Magistral 模型。
Mistral AI 发布语音理解模型 Voxtral,提供 24B 和 3B 两个尺寸,均以 Apache 2.0 许可开源,并已上线其 API。模型支持 32k token 上下文,可处理最长 30 分钟的音频转写或 40 分钟的音频理解,还能根据语音意图直接触发函数调用。
推荐理由:原文对比了开源 ASR 与闭源 API 在成本、部署上的取舍,并给出两档尺寸和 API 定价,可作为语音方案选型参考。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并将 Devstral Small 升级到 1.1,两款模型都强调对不同提示词和智能体框架的泛化能力。
推荐理由:官方给出两款编码智能体模型的 SWE-Bench 分数与 API 定价,便于比较开源与商业方案的成本性能。
Mistral AI 宣布推出 AI for Citizens 倡议,帮助各国政府与公共机构战略性地运用 AI,以变革公共服务、推动创新并提升竞争力。该倡议基于开放、协作、选择与自主原则,提供自托管、AI 数据中心、SaaS 和 serverless API 等部署选项,并支持数据主权。其正与法国、卢森堡、新加坡、荷兰、英格兰、瑞士等国政府、国防部队、公共部门机构及教育机构合作。
Mistral AI 宣布推出 Mistral Compute,为客户提供私有的集成 AI 基础设施栈,涵盖 GPU、编排、API、产品与服务,形态从裸金属服务器到全托管 PaaS。
Mistral AI 发布首个推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:原文列出两档模型的 AIME2024 分数、开源许可与部署渠道,便于比较开源推理模型的落地方式。
Mistral 发布企业级 AI 编程助手 Mistral Code,基于开源项目 Continue 构建,已面向 JetBrains IDE 和 VSCode 开放私有测试版,正式版即将推出。
Mistral AI 发布首个代码专用嵌入模型 Codestral Embed,称其检索性能显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
Mistral 发布 Agents API,把自家语言模型与代码执行、网页搜索、图像生成、MCP 工具等内置连接器以及跨对话持久记忆、多智能体编排结合起来。官方称启用网页搜索后,Mistral Large 与 Mistral Medium 在 SimpleQA 基准上的得分分别为 75% 和 82.32%,未启用时为 23% 和 22.08%。
推荐理由:原文列出内置连接器、持久记忆与多智能体编排的具体能力和示例,可据此判断它适合哪类智能体工作流。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,超过此前开源 SoTA 6 个百分点以上。
推荐理由:给出同框架模型对比数据、单卡部署门槛与 API 价格,可帮助判断开源编码智能体当前的能力水位与落地条件。
Mistral AI 推出企业级 AI 助手 Le Chat Enterprise,由全新的 Mistral Medium 3 模型驱动。新方案提供企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署,功能将在未来两周内陆续上线。
Mistral AI 发布 Mistral Medium 3,称其以每百万 token 输入 $0.4、输出 $2 的定价,在各项基准上达到 Claude Sonnet 3.7 的 90% 或以上。
推荐理由:原文给出对标 Claude Sonnet 3.7 的基准表现与每百万 token 定价,可据此衡量中型模型在企业场景中的成本位置。
Mistral 展示用 LLM as a Judge 评估 RAG:由 judge LLM 按数值或定性量表为 generator LLM 的答案打分。评判采用 TruLens 的 RAG Triad 三项指标,并通过 Mistral API 近期上线的结构化输出,按自定义 schema 返回可机读的评分与解释。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升了文本表现和多模态理解,上下文窗口扩展至最高 128k tokens。
推荐理由:官方列出多模态、长上下文与推理速度指标,可对照 Gemma 3、GPT-4o Mini 判断开源小模型的性能位置。
TensorFlow 2.19 已发布,LiteRT 的 C++ API 有所调整,tfl.Cast op 运行时内核新增 bfloat16 支持,并停止发布 libtensorflow 包。tf.lite.Interpreter 已给出弃用警告,改指向 ai_edge_litert.interpreter,并将在 TF 2.20 中删除。
Mistral 发布 Mistral OCR,一款以图像和 PDF 为输入、按顺序交错输出文本与图片的 OCR API,并已成为 Le Chat 文档理解的默认模型。
推荐理由:官方列出与 Google Document AI、Azure OCR、Gemini 等模型的横向基准对比,可用于判断文档解析模型的当前水位。
Mistral AI 的 TranscriptToPRDTicket 智能体工作流由 Mistral Large 2 驱动,可把会议转录自动生成 PRD 和开发工单,并写入 Linear、Jira 等项目管理工具。
哈佛大学团队发布 Wake Vision 数据集,约 600 万张图像,规模约为 TinyML 人物检测数据集 VWW 的 100 倍。数据集分为侧重规模的 Large 与侧重标注质量的 Quality 两个训练集,精度较 VWW 最高提升 6.6%,人工标注验证下错误率从 7.8% 降至 2.2%。
TensorFlow 博客发文介绍开源教材 MLSysBook.AI,把机器学习系统工程的五个环节与 TensorFlow 生态工具逐一对齐。
TensorFlow 2.18 发布,支持 NumPy 2.0,并带来 LiteRT 仓库、Hermetic CUDA 与 CUDA 更新。TFLite 代码库将迁移至 LiteRT,完成后不再发布 TFLite 二进制版本。二进制包新增计算能力 8.9 的 CUDA kernel,最低支持 Pascal 架构。
TensorFlow 2.17 发布,为 compute capability 8.9 GPU 新增专用 CUDA 内核,提升 RTX 40 系列、L4、L40 性能。
XNNPack 为 TensorFlow Lite 的 Fully Connected 和 Convolution 2D 算子加入动态范围量化支持,CPU 推理性能较 fp32 基线提升 4 倍。
TensorFlow 2.16 发布,Keras 3 成为默认版本,Windows 上 CPU wheel 改用 Clang 17 编译,并支持 Python 3.12。
TensorFlow GNN 1.0(TF-GNN)发布,这是一个经过生产验证、可大规模构建图神经网络(GNN)的库,支持在 TensorFlow 中建模训练并从大型数据存储抽取输入图。
TensorFlow 发布 Linux x86_64 平台热修复版 2.15.0.post1,解决 2.15.0 因 tensorrt 依赖引发的安装失败。该版本从 pip install tensorflow[and-cuda] 安装方式中移除 tensorrt Python 包依赖,此前用户会收到安装错误或改而装上 2.14。
TensorFlow Lite 的 XNNPack 后端在 ARM CPU 上启用半精度(FP16)推理,浮点模型端侧推理性能提升 2 倍,现已正式可用。
TensorFlow 2.15 发布,Linux 上新增通过 pip install tensorflow[and-cuda] 安装 NVIDIA CUDA 库依赖的可选方式,CUDA 升级至 12.2。
Google 将于 12 月 7 日 9:30 至 13:00 PT 线上举办第三届年度 Women in ML Symposium,需提前 RSVP 报名。议程覆盖生成式 AI 最新进展、隐私保护 AI、驱动模型的加速器与 ML 框架,以及 ML 在多个行业的实际应用,并为初学者到资深从业者分设不同层级的场次。Google Health、Nvidia、Adobe 等机构的行业人士将参与分享。
Spotify 基于 TF-Agents Environment 原语构建离线模拟器,用 Keras 训练的用户模型预测用户对推荐曲目的反应。团队训练并评估了顺序推荐模型、PPG、DQN 和改进的 Action-Head DQN(AH-DQN),以应对大状态与动作空间。线上实验显示离线性能估计与线上结果强相关。
借助 TensorFlow Lite 的 Flutter 插件,此前用 TensorFlow 训练并转为 TFLite 的强化学习棋盘游戏 Plane Strike 被移植到 Flutter,可在 Android 和 iOS 上运行。