Hugging Face 模型页现可展示 Every Eval Ever 评测结果
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,评测分数可同时出现在 Hugging Face 模型页和 benchmark 排行榜,并带徽章链接回完整 EEE 记录。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,评测分数可同时出现在 Hugging Face 模型页和 benchmark 排行榜,并带徽章链接回完整 EEE 记录。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能在浏览器、移动端和桌面看、推理并执行操作的智能体。
推荐理由:原文交代了 computer use 从独立模型并入 Flash 主模型这一变化,以及配套的两项企业安全护栏。
Mistral 为 Connectors 新增多项能力:按 workspace 或组织分配访问权限、可逐个开关工具的管理控制,带 connector 作用域的 API key 与多账号 connector 均已正式可用。
Google DeepMind 与英国政府、Google Cloud、Faculty 合作开发基于 Gemini 的 AI 规划原型,目标将住户规划申请决策时间缩短 50%。
Google 在 Gemini Enterprise Agent Platform 上线基于 Agentic RAG 的跨语料检索(Cross-Corpus Retrieval),现已开放公开预览。
Google Research 在 GitHub 以 Apache 2.0 协议开源其水文建模框架,供各国气象水文机构在自己的流程中训练 AI 洪水预报模型。
Google 在 I/O 2026 发布 Gemini for Science 实验性工具套件,其中 Computational Discovery 基于 ERA 与 AlphaEvolve,可并行生成并评分数千个代码变体,Hypothesis Generation 则由 Co-Scientist 构建。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,联合 Airbus、BMW 和 ASML 优化设计、仿真与生产,并强调对专有数据、IP 和生产环境的完全控制。
Mistral 发布统一 AI 智能体 Vibe,Le Chat 更名为 Vibe,把工作与编码合并为同一智能体和同一授权,原有对话、设置和套餐随之保留。
推荐理由:Le Chat 更名并整合为工作与编码双模式的智能体,可对照其分档定价与 VS Code 接入了解产品定位。
Mistral AI 发布 Search Toolkit 公开预览版,这是把数据接入、检索和评测整合到同一配置接口的开源框架,可运行在云、本地和边缘环境。它内置 BM25 稀疏检索、稠密向量检索与混合配置,并提供 recall、precision、MRR、NDCG 评测指标,可在自有测试集上对比不同检索配置。
Mistral 将 Emmi AI 并入,构建面向 AI 原生工业工程的物理 AI 基础能力。该模型从几何与边界条件直接预测物理场,单 GPU 上单次前向传播即可秒级完成,而传统 CFD/FEM 每个设计变体需数小时到数周。合作伙伴包括 ASML、Airbus、Safran 与 Siemens Energy。
Mistral 在 Studio 发布 Connectors(公开预览),内置连接器和自定义 MCP 现在都能通过 API/SDK 用于所有模型与智能体调用。新增的直接工具调用让开发者自行决定何时调用工具,requires_confirmation 可在工具执行前插入人工审批。连接器集中注册后可在 LeChat 与 AI Studio 中复用,Vibe 也即将支持。
推荐理由:Mistral 把企业数据集成封装成可复用的连接器,读者可据此评估自建 Agent 集成层的重复维护成本。
Google DeepMind 为实验性原型 Project Genie 加入 Google 街景锚定能力,用户可基于美国真实地点生成可交互的想象世界。该能力由 Maps Imagery Grounding 支持,可搭配 “Desert Sands”“Stone Age” 等风格,并描述自己的角色来生成世界,街景地点目前覆盖美国,后续计划扩展。
Google 发布 Gemini for Science,在 Google Labs 上线 Hypothesis Generation、Computational Discovery、Literature Insights 三个科学实验原型,并推出可在 Google Antigravity 使用的 Science Skills。
Google 把 SynthID 的图像、视频和音频验证扩展到搜索,并将在未来几周进入 Chrome,该能力此前已在 Gemini 应用中累计使用 5000 万次。
推荐理由:在生成媒体普及的背景下,SynthID 已为超 1000 亿件图像视频加上水印,读者可了解各产品验证入口的分批上线节奏。
Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,用于把 AI 驱动的流程稳定投入生产。Workflows 基于 Temporal 的持久化执行引擎构建,提供持久化执行、可观测性和单行代码的人工审批,并针对 AI 负载扩展了流式处理、负载处理与可观测性;控制平面由 Mistral 托管,workers 部署在企业自己的 Kubernetes 环境。
Google 将一套 3D 感知的照片重构图方法上线到 Google Photos 的 Auto frame 功能,可自动调整相机视角并补全原本未拍到的画面。该方法先用内部 3D 点图估计模型获取每个像素的 3D 点并估算原相机焦距,再用生成式潜空间扩散模型填补新视角渲染后出现的空缺。
推荐理由:相较裁剪和缩放,这套方法把照片还原成 3D 场景并重设相机视角,可了解生成式修图的一种实现路径。
Google 在 Google Labs 上线研究实验 Vantage,用生成式 AI 搭建多角色模拟对话,评估高中生与大学生面向未来的技能(批判性思维、协作、创造性思维)。
Mistral AI 发布 Spaces CLI,用 spaces init、cd、spaces dev 三条命令即可从零得到带热重载、数据库和自动生成 Dockerfile 的多服务项目。
推荐理由:Mistral 把 CLI 同时服务人类与编码智能体的设计原则整理成检查清单,可对照改造自家开发者工具。
Google DeepMind 公布由 Gemini 驱动的 AI 指针研究,让指针不仅能识别指向的对象,还能理解用户意图,并用指向加语音替代长提示词。团队提出维持工作流、边指边说、支持「这个」和「那个」、把像素变成可操作实体四条交互原则。
推荐理由:DeepMind 把指针变成能理解所指内容的 Gemini 入口,并已落地 Chrome,读者可据此观察交互从写提示词转向指向与语音。
Google 发布 Vibe Coding XR 工作流,将 Gemini 与基于 Web 的 XR Blocks 框架结合,把自然语言直接转成具备物理感知的 Android XR 应用,耗时低于 60 秒。
Mistral AI 推出 Forge,一套让企业用自有专有知识训练前沿级模型的系统,覆盖预训练、后训练与强化学习,支持稠密与 MoE 架构。Forge 按 agent 优先设计,Mistral Vibe 等智能体可用自然语言完成微调、超参数搜索与数据合成。合作方包括 ASML、Ericsson、欧洲空间局、新加坡 HTX 与 Reply。
Google 在 Flood Hub 上线城市山洪预报,用新的 AI 方法可提前 24 小时预测城市山洪风险。该方法用 Gemini 分析公开新闻报告以确认洪灾地点和时间,据此构建 Groundsource 历史山洪事件数据集用于训练与评估,模型采用含 LSTM 的 RNN 架构,当前空间分辨率为 20x20 公里。
Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动。2.0 新增自定义子智能体、多选澄清、斜杠命令技能、统一智能体模式与自动更新,已在 Le Chat Pro 和 Team 套餐上线,超出额度可按量付费或自带 API key。
推荐理由:原文列出 Vibe 2.0 新增的子智能体、斜杠命令技能等控制项与定价变化,可供判断终端编码智能体的使用成本。
Mistral AI 发布 Mistral AI Studio,一个由 Observability、Agent Runtime 和 AI Registry 三大支柱组成的生产级 AI 平台。
Mistral 为 Le Chat 推出 Memories(beta)记忆功能,会自动保存有用信息,并在调用时给出指向来源的链接。用户可以随时关闭记忆、开启不使用记忆的隐身对话、编辑或删除单条记忆,还能导出和从别处导入记忆数据。官方同时上线 Memory Insights 提示词,帮助用户查看 Le Chat 记住了什么,并称后续将支持按类别整理记忆和查看记忆何时被使用。
Mistral AI 在 Le Chat 上线 20 多个基于 MCP 的安全连接器(beta)和 Memories(beta),免费版用户即可使用,还能接入目录之外的任意远程 MCP 服务器。
TensorFlow 2.20 发布,tf.lite 模块将弃用,端侧推理开发迁移至独立仓库 LiteRT,新 API 提供 Kotlin 和 C++ 版本。LiteRT 面向 NPU 和 GPU 硬件加速,为 NPU 提供统一接口,并通过零拷贝硬件缓冲减少内存拷贝。
Mistral 为 Le Chat 推出一批新功能,包括 Deep Research(预览)、语音模式、原生多语言推理、Projects 和图像编辑。Deep Research 由工具增强的研究 agent 驱动,可产出带引用的结构化报告;语音模式基于新语音模型 Voxtral,推理能力来自 Magistral 模型。
Mistral AI 宣布推出 AI for Citizens 倡议,帮助各国政府与公共机构战略性地运用 AI,以变革公共服务、推动创新并提升竞争力。该倡议基于开放、协作、选择与自主原则,提供自托管、AI 数据中心、SaaS 和 serverless API 等部署选项,并支持数据主权。其正与法国、卢森堡、新加坡、荷兰、英格兰、瑞士等国政府、国防部队、公共部门机构及教育机构合作。
Mistral AI 宣布推出 Mistral Compute,为客户提供私有的集成 AI 基础设施栈,涵盖 GPU、编排、API、产品与服务,形态从裸金属服务器到全托管 PaaS。
Mistral 发布企业级 AI 编程助手 Mistral Code,基于开源项目 Continue 构建,已面向 JetBrains IDE 和 VSCode 开放私有测试版,正式版即将推出。
Mistral 发布 Agents API,把自家语言模型与代码执行、网页搜索、图像生成、MCP 工具等内置连接器以及跨对话持久记忆、多智能体编排结合起来。官方称启用网页搜索后,Mistral Large 与 Mistral Medium 在 SimpleQA 基准上的得分分别为 75% 和 82.32%,未启用时为 23% 和 22.08%。
推荐理由:原文列出内置连接器、持久记忆与多智能体编排的具体能力和示例,可据此判断它适合哪类智能体工作流。
Mistral AI 推出企业级 AI 助手 Le Chat Enterprise,由全新的 Mistral Medium 3 模型驱动。新方案提供企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署,功能将在未来两周内陆续上线。
TensorFlow 2.19 已发布,LiteRT 的 C++ API 有所调整,tfl.Cast op 运行时内核新增 bfloat16 支持,并停止发布 libtensorflow 包。tf.lite.Interpreter 已给出弃用警告,改指向 ai_edge_litert.interpreter,并将在 TF 2.20 中删除。
TensorFlow 2.18 发布,支持 NumPy 2.0,并带来 LiteRT 仓库、Hermetic CUDA 与 CUDA 更新。TFLite 代码库将迁移至 LiteRT,完成后不再发布 TFLite 二进制版本。二进制包新增计算能力 8.9 的 CUDA kernel,最低支持 Pascal 架构。
TensorFlow 2.17 发布,为 compute capability 8.9 GPU 新增专用 CUDA 内核,提升 RTX 40 系列、L4、L40 性能。
XNNPack 为 TensorFlow Lite 的 Fully Connected 和 Convolution 2D 算子加入动态范围量化支持,CPU 推理性能较 fp32 基线提升 4 倍。
TensorFlow 2.16 发布,Keras 3 成为默认版本,Windows 上 CPU wheel 改用 Clang 17 编译,并支持 Python 3.12。
TensorFlow 发布 Linux x86_64 平台热修复版 2.15.0.post1,解决 2.15.0 因 tensorrt 依赖引发的安装失败。该版本从 pip install tensorflow[and-cuda] 安装方式中移除 tensorrt Python 包依赖,此前用户会收到安装错误或改而装上 2.14。