Hugging Face 模型页现可展示 Every Eval Ever 评测结果
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,评测分数可同时出现在 Hugging Face 模型页和 benchmark 排行榜,并带徽章链接回完整 EEE 记录。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,评测分数可同时出现在 Hugging Face 模型页和 benchmark 排行榜,并带徽章链接回完整 EEE 记录。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:原文说明 DiffusionGemma 与 Gemma 4 的分工,前者面向低并发本地推理,并列出速度与质量上的取舍。
Google DeepMind 发布 Gemma 4 12B,一款无编码器的多模态模型,可在笔记本本地运行。该模型把视觉输入改为单次矩阵乘法的轻量嵌入模块,并去掉音频编码器,将原始音频信号投影到与文本 token 相同的维度,是 Gemma 4 系列首款支持原生音频输入的中等规模模型。
推荐理由:Gemma 4 12B 用无编码器架构让视觉和音频直接进入 LLM,性能接近 26B MoE 而内存占用不到一半。
Google Research 在 GitHub 以 Apache 2.0 协议开源其水文建模框架,供各国气象水文机构在自己的流程中训练 AI 洪水预报模型。
Mistral 发布 Mistral Medium 3.5,这是一个 128B 稠密模型,以开源权重、修改版 MIT 许可发布,并成为 Mistral Vibe 和 Le Chat 的默认模型。
推荐理由:把编码智能体迁到云端并以 128B 开源权重模型驱动,读者可据此判断自托管部署与异步并行任务的成本变化。
Google Research 用合成神经元形状增强 PATHFINDER 训练数据,将小鼠轴突重建误差降低 4.4%。其 MoGen 模型基于 PointInfinity 点云流匹配,用 1,795 个小鼠皮层轴突训练,训练数据加入 10% 合成形状即可减少合并错误。MoGen 已开源,论文将在 ICLR 2026 发表;按完整小鼠脑规模计算,相当于节省 157 人年人工校对。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。
推荐理由:原文列出四档尺寸、Arena 排名与 Apache 2.0 许可,便于判断本地部署和微调的硬件与授权取舍。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,已通过 API 提供,定价 $0.016 / 1k 字符。
推荐理由:官方给出了 4B 模型在 9 种语言上的延迟、单价以及和 ElevenLabs 的人评对比口径,便于判断语音 Agent 的选型与成本。
Mistral AI 发布 Mistral Small 4,称其是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的编码智能体能力统一进单一模型的 Mistral 模型,以 Apache 2.0 许可开源。
推荐理由:Mistral Small 4 把推理、多模态与编码能力合进一个开源模型,读者可据此评估单模型替代多模型组合的部署取舍。
Mistral AI 宣布以创始成员身份加入 NVIDIA Nemotron Coalition,计划与 NVIDIA 联合开发前沿开源 AI 模型,Mistral AI 提供模型架构、训练技术、多模态能力和企业级微调工具,NVIDIA 提供算力、模型开发工具与合成数据管线。
Mistral 发布 Leanstral,首个面向 Lean 4 的开源代码智能体,Apache 2.0 开源并提供免费 API。该模型激活参数 6B,采用稀疏架构,支持任意 MCP,并针对 lean-lsp-mcp 训练,也可在 Mistral vibe 的 agent 模式中使用。
Mistral 基于其开源编码助手 Vibe 构建了一个自动为 Rails 代码库生成和改进 RSpec 测试的智能体,可在 CI/CD 中无人干预运行。该智能体依靠仓库级 AGENTS.md 执行计划、按文件类型拆分的 Skills 文件,以及 RuboCop 与 SimpleCov 自定义工具完成生成、校验和自校正。
Mistral 发布 Voxtral Transcribe 2 系列两款语音转写模型,包括用于批处理的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,后者以 Apache 2.0 权重在 Hugging Face 开源。
推荐理由:Realtime 以 sub-200ms 延迟和 Apache 2.0 权重开源,读者可据此比较实时语音应用的端侧落地成本。
Mistral AI 发布新一代编码模型系列 Devstral 2,包含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,两者均开源,分别采用修改版 MIT 和 Apache 2.0 许可。
推荐理由:材料给出 Devstral 2 在 SWE-bench Verified 上 72.2% 的成绩,并附上与 DeepSeek V3.2、Claude Sonnet 4.5 的人工评测胜负对比。
Mistral 发布 Mistral 3 模型家族,包含稀疏 MoE 的 Mistral Large 3(41B 激活、675B 总参数)与三款密集小模型 Ministral 3(3B、8B、14B),全部以 Apache 2.0 开源。
推荐理由:Mistral 3 一并公布参数规模、开源许可与硬件适配方案,读者可据此对照自身部署条件判断选型。
Mistral 发布 Codestral 25.08 及配套企业编码栈,涵盖补全、语义检索、智能体工作流和 Mistral Code IDE 插件,今日起可用于企业部署。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并将 Devstral Small 升级到 1.1,两款模型都强调对不同提示词和智能体框架的泛化能力。
推荐理由:官方给出两款编码智能体模型的 SWE-Bench 分数与 API 定价,便于比较开源与商业方案的成本性能。
Mistral AI 宣布推出 AI for Citizens 倡议,帮助各国政府与公共机构战略性地运用 AI,以变革公共服务、推动创新并提升竞争力。该倡议基于开放、协作、选择与自主原则,提供自托管、AI 数据中心、SaaS 和 serverless API 等部署选项,并支持数据主权。其正与法国、卢森堡、新加坡、荷兰、英格兰、瑞士等国政府、国防部队、公共部门机构及教育机构合作。
Mistral AI 发布首个推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:原文列出两档模型的 AIME2024 分数、开源许可与部署渠道,便于比较开源推理模型的落地方式。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,超过此前开源 SoTA 6 个百分点以上。
推荐理由:给出同框架模型对比数据、单卡部署门槛与 API 价格,可帮助判断开源编码智能体当前的能力水位与落地条件。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升了文本表现和多模态理解,上下文窗口扩展至最高 128k tokens。
推荐理由:官方列出多模态、长上下文与推理速度指标,可对照 Gemma 3、GPT-4o Mini 判断开源小模型的性能位置。
TensorFlow 2.19 已发布,LiteRT 的 C++ API 有所调整,tfl.Cast op 运行时内核新增 bfloat16 支持,并停止发布 libtensorflow 包。tf.lite.Interpreter 已给出弃用警告,改指向 ai_edge_litert.interpreter,并将在 TF 2.20 中删除。
TensorFlow 2.17 发布,为 compute capability 8.9 GPU 新增专用 CUDA 内核,提升 RTX 40 系列、L4、L40 性能。
TensorFlow 2.16 发布,Keras 3 成为默认版本,Windows 上 CPU wheel 改用 Clang 17 编译,并支持 Python 3.12。
TensorFlow 2.15 发布,Linux 上新增通过 pip install tensorflow[and-cuda] 安装 NVIDIA CUDA 库依赖的可选方式,CUDA 升级至 12.2。
TensorFlow v2 通过 DTensor 原生支持分布式 FFT,分片张量可直接传入 tf.signal.fft2d 等既有算子,输出同样保持分片。8xV100 GPU 上的 10K*10K 实验中,两个本地 FFT 算子只占总耗时 15ms 的 3.6%,约为非分布式 fft2d 的 1/3,其余时间主要耗在 ncclAllToAll 数据重排上。
TensorFlow 2.13 与 Keras 2.13 已发布,TensorFlow 2.13 首次提供 Apple Silicon wheels,Keras V3 保存格式成为 .keras 扩展名文件的默认格式。