Mistral AI 发布 Spaces CLI,兼顾人类开发者与编码智能体
Mistral AI 发布 Spaces CLI,用 spaces init、cd、spaces dev 三条命令即可从零得到带热重载、数据库和自动生成 Dockerfile 的多服务项目。
推荐理由:Mistral 把 CLI 同时服务人类与编码智能体的设计原则整理成检查清单,可对照改造自家开发者工具。
Mistral AI 发布 Spaces CLI,用 spaces init、cd、spaces dev 三条命令即可从零得到带热重载、数据库和自动生成 Dockerfile 的多服务项目。
推荐理由:Mistral 把 CLI 同时服务人类与编码智能体的设计原则整理成检查清单,可对照改造自家开发者工具。
Google 推出 TurboQuant,一种零精度损失的压缩算法,可同时压缩 KV cache 并加速向量搜索。它先用 PolarQuant 随机旋转向量完成主体压缩,再用 1 bit 的 QJL 消除残差误差,TurboQuant 将在 ICLR 2026 展示。
Google 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项论文,分别评估 AI 乳腺癌筛查系统的独立性能及其作为第二读片人嵌入双读流程的效果。
推荐理由:两项研究给出了AI作为第二读片人的性能数据与部署细节,可供评估AI嵌入既有人工复核流程的可行性与难点。
Mistral AI 推出 Forge,一套让企业用自有专有知识训练前沿级模型的系统,覆盖预训练、后训练与强化学习,支持稠密与 MoE 架构。Forge 按 agent 优先设计,Mistral Vibe 等智能体可用自然语言完成微调、超参数搜索与数据合成。合作方包括 ASML、Ericsson、欧洲空间局、新加坡 HTX 与 Reply。
Mistral AI 团队复盘了 vLLM 中的一次内存泄漏排查。在他们用 Mistral Medium 3.1 做 P/D 分离部署并启用图编译时,系统内存以每分钟 400 MB 线性增长,数小时后会进入 OOM 状态。
Mistral AI 发布 Mistral AI Studio,一个由 Observability、Agent Runtime 和 AI Registry 三大支柱组成的生产级 AI 平台。
TensorFlow 2.20 发布,tf.lite 模块将弃用,端侧推理开发迁移至独立仓库 LiteRT,新 API 提供 Kotlin 和 C++ 版本。LiteRT 面向 NPU 和 GPU 硬件加速,为 NPU 提供统一接口,并通过零拷贝硬件缓冲减少内存拷贝。
Mistral 发布 Codestral 25.08 及配套企业编码栈,涵盖补全、语义检索、智能体工作流和 Mistral Code IDE 插件,今日起可用于企业部署。
Mistral AI 宣布推出 AI for Citizens 倡议,帮助各国政府与公共机构战略性地运用 AI,以变革公共服务、推动创新并提升竞争力。该倡议基于开放、协作、选择与自主原则,提供自托管、AI 数据中心、SaaS 和 serverless API 等部署选项,并支持数据主权。其正与法国、卢森堡、新加坡、荷兰、英格兰、瑞士等国政府、国防部队、公共部门机构及教育机构合作。
Mistral AI 宣布推出 Mistral Compute,为客户提供私有的集成 AI 基础设施栈,涵盖 GPU、编排、API、产品与服务,形态从裸金属服务器到全托管 PaaS。
Mistral 发布企业级 AI 编程助手 Mistral Code,基于开源项目 Continue 构建,已面向 JetBrains IDE 和 VSCode 开放私有测试版,正式版即将推出。
Mistral AI 推出企业级 AI 助手 Le Chat Enterprise,由全新的 Mistral Medium 3 模型驱动。新方案提供企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署,功能将在未来两周内陆续上线。
Mistral AI 发布 Mistral Medium 3,称其以每百万 token 输入 $0.4、输出 $2 的定价,在各项基准上达到 Claude Sonnet 3.7 的 90% 或以上。
推荐理由:原文给出对标 Claude Sonnet 3.7 的基准表现与每百万 token 定价,可据此衡量中型模型在企业场景中的成本位置。
TensorFlow 2.19 已发布,LiteRT 的 C++ API 有所调整,tfl.Cast op 运行时内核新增 bfloat16 支持,并停止发布 libtensorflow 包。tf.lite.Interpreter 已给出弃用警告,改指向 ai_edge_litert.interpreter,并将在 TF 2.20 中删除。
Mistral 发布 Mistral OCR,一款以图像和 PDF 为输入、按顺序交错输出文本与图片的 OCR API,并已成为 Le Chat 文档理解的默认模型。
推荐理由:官方列出与 Google Document AI、Azure OCR、Gemini 等模型的横向基准对比,可用于判断文档解析模型的当前水位。
TensorFlow 博客发文介绍开源教材 MLSysBook.AI,把机器学习系统工程的五个环节与 TensorFlow 生态工具逐一对齐。
TensorFlow 2.18 发布,支持 NumPy 2.0,并带来 LiteRT 仓库、Hermetic CUDA 与 CUDA 更新。TFLite 代码库将迁移至 LiteRT,完成后不再发布 TFLite 二进制版本。二进制包新增计算能力 8.9 的 CUDA kernel,最低支持 Pascal 架构。
TensorFlow 2.17 发布,为 compute capability 8.9 GPU 新增专用 CUDA 内核,提升 RTX 40 系列、L4、L40 性能。
XNNPack 为 TensorFlow Lite 的 Fully Connected 和 Convolution 2D 算子加入动态范围量化支持,CPU 推理性能较 fp32 基线提升 4 倍。
TensorFlow 2.16 发布,Keras 3 成为默认版本,Windows 上 CPU wheel 改用 Clang 17 编译,并支持 Python 3.12。
TensorFlow GNN 1.0(TF-GNN)发布,这是一个经过生产验证、可大规模构建图神经网络(GNN)的库,支持在 TensorFlow 中建模训练并从大型数据存储抽取输入图。
TensorFlow 发布 Linux x86_64 平台热修复版 2.15.0.post1,解决 2.15.0 因 tensorrt 依赖引发的安装失败。该版本从 pip install tensorflow[and-cuda] 安装方式中移除 tensorrt Python 包依赖,此前用户会收到安装错误或改而装上 2.14。
TensorFlow Lite 的 XNNPack 后端在 ARM CPU 上启用半精度(FP16)推理,浮点模型端侧推理性能提升 2 倍,现已正式可用。
TensorFlow 2.15 发布,Linux 上新增通过 pip install tensorflow[and-cuda] 安装 NVIDIA CUDA 库依赖的可选方式,CUDA 升级至 12.2。
借助 TensorFlow Lite 的 Flutter 插件,此前用 TensorFlow 训练并转为 TFLite 的强化学习棋盘游戏 Plane Strike 被移植到 Flutter,可在 Android 和 iOS 上运行。
TensorFlow v2 通过 DTensor 原生支持分布式 FFT,分片张量可直接传入 tf.signal.fft2d 等既有算子,输出同样保持分片。8xV100 GPU 上的 10K*10K 实验中,两个本地 FFT 算子只占总耗时 15ms 的 3.6%,约为非分布式 fft2d 的 1/3,其余时间主要耗在 ncclAllToAll 数据重排上。
TensorFlow 团队用 Simpleperf 剖析并优化 TFLite 内存 arena 的初始化过程,tensor 分配开销从运行时占比 49.9% 降到 11%,示例模型运行时缩短 25%。
TensorFlow 2.13 与 Keras 2.13 已发布,TensorFlow 2.13 首次提供 Apple Silicon wheels,Keras V3 保存格式成为 .keras 扩展名文件的默认格式。
Google Research 健康 AI 团队展示如何用 TensorFlow Lite 在手机上运行孕龄与胎位评估模型,让只接受几小时培训、没有超声背景的人员通过盲扫协议采集视频就能得到与标准诊疗相当的预测结果。