NeoMME 发布:高效多模态原生多语言编码器
NeoMME 发布,这是一个包含 260M 和 800M 两个版本的多语言多模态编码器家族,用单个双向 Transformer 同时处理文本 token 和原始图像 patch,不依赖预训练视觉塔或因果语言模型。
NeoMME 发布,这是一个包含 260M 和 800M 两个版本的多语言多模态编码器家族,用单个双向 Transformer 同时处理文本 token 和原始图像 patch,不依赖预训练视觉塔或因果语言模型。
OpenAI 发布 GPT-6 Astra,称其为目前最智能、对齐程度最高的模型,在计算机操作、编码、网络安全和科学等方向具备 SOTA 能力。官方摘要未给出参数规模、上下文窗口或开放时间等细节。
推荐理由:OpenAI 公布 GPT-6 Astra 在计算机操作、编码、网络安全与科学方向的能力覆盖,读者可据此了解新模型的定位。
Google 发布 TimesFM-3,一个原生支持多变量零样本预测的时间序列基础模型,在 Gift-Eval、FEV-Bench 和 Time 三个公开基准上,无论点预测还是概率预测都取得预训练基础模型中的最佳平均排名。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景扩展、首尾帧插值、360p 快速草稿和最高 4K 放大等生成式视频能力,已通过 Gemini API 在 Google AI Studio 上线。
推荐理由:相较于此前只参考最后一秒,Omni 1.1 把场景扩展的前序上下文提高到 10 秒,便于评估长视频工作流的可行性。
Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe,官方称其为迄今最精确的一版,按 Artificial Analysis 测量,流式平均 WER 为 4.0%、非流式为 2.6%。
IBM Granite 团队发布 Granite 4.2 推理模型系列,包含 3B、8B、30B 三个 dense、decoder-only 规模,全部以 Apache 2.0 许可开放。
推荐理由:原文公开了从五阶段预训练到多阶段 RL 的完整构建配方,可对照其他推理模型的开源训练路径。
Liquid AI 发布 LFM2.5-DSpark 草稿模型检查点,覆盖 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型,通过投机解码在不改变输出质量的前提下最高提升 3.18 倍吞吐。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码和 Agent 的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:原文列出 Gemini 3.7 Flash 相对 3.6 Flash 的多项基准提升与半价定价,便于判断是否值得升级。
Google DeepMind 发布多语言手语转文本模型 SL2T,并在 Gboard 与 Live Transcribe 中上线手语听写功能,先在 Pixel 11 上支持美国手语(ASL)转英文。
推荐理由:SL2T 用 10 万小时、50 多种手语数据训练并直接落到 Gboard 与 Live Transcribe,可作为手语翻译产品化的参考。
NVIDIA 发布 Magpie TTS Multilingual,一款 364M 参数的开放权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。官方数据显示 B200 单流首音频延迟 32ms,64 并发流下 TTFA 239ms、吞吐约 320 倍实时。模型提供 Hugging Face 开放权重与 NVIDIA NIM 生产部署,并可用 NeMo 微调发音和音色。
Meta 发布开源多模态模型 Muse Glimmer,30B 参数、Apache 2.0 许可,面向本地智能体场景。模型由 2B 视觉编码器与 28B 文本解码器组成,并附带 DFlash 投机解码草稿模型,transformers、llama.cpp、vLLM 与 Inference Endpoints 均已提供 day-0 支持。
推荐理由:30B 多模态模型以 Apache 2.0 开放并在多智能体基准上与同级模型对比,可供本地部署的选型参考。
Google DeepMind 的 WeatherNext AI 模型在气旋路径、强度和风场结构预测上达到当前最优精度,平均为预报员多争取约一天的有效提前量,成果发表在 Nature。
推荐理由:原文给出气旋路径与强度预测的领先幅度,并公开模型权重与代码,可对照传统预报方法理解改进来源。
Mistral AI 发布 3B 开源多模态安全分类器 Shieldstral,以 Apache 2.0 开放权重,可在单张 16GB NVIDIA GPU 上运行。
推荐理由:Mistral 把内容审核改写成推理时的自然语言问答,给出了小模型适配新策略的可迁移做法。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,负责与人类对话、理解物理世界并规划多步任务,再把运动执行交给底层 VLA 模型。
推荐理由:官方给出 Gemini Robotics ER 2 相比 ER 1.6 和前沿模型在进度分类、时刻定位上的指标,读者可据此判断机器人具身推理的当前水平。
Google 在 Google Flow Music 上线最新音乐生成模型 Lyria 3.5,在音乐性、歌词、人声和创作控制四方面均有提升。新模型可生成更丰富复杂的旋律结构,歌词质量更高且提示词遵循与结构感知更好,人声更具表现力与情感、发音更准确。用户还可更便捷地控制输出节奏与时长,即日起可试用。
Google DeepMind 发布 Gemini Robotics 2,由三款模型组成,让机器人实现全身控制、灵巧操作和多机器人协作。其中 Gemini Robotics ER 2 已上线 Google AI Studio 并在 Gemini Enterprise Agent Platform 私密预览,VLA 与端侧模型面向早期接入合作伙伴。
推荐理由:从控制机器人上半身扩展到全身控制,并加入多机协作与端侧快速适配,可了解机器人基础模型的当前能力边界。
NVIDIA 发布 Cosmos-H-Dreams,一款面向手术机器人的实时、动作条件生成式模拟器,把 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向代码安全的 3.5 Flash Cyber 三款模型。
推荐理由:三款模型同时给出 token 效率、单 token 价格与智能体基准变化,可作为评估智能体工作流成本的参考。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 构建并微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等评测中与体量大得多的模型表现相当。
推荐理由:原文给出该模型在 CyberGym、Chrome 产线扫描等评测中的对比数据,以及仅面向政府和可信伙伴的试点开放方式。
Thinking Machines 发布开源多模态模型 Inkling,总参数 975B、激活 41B,支持 1M 上下文并原生接收图像、音频和文本输入。同期推出 Inkling-Small(总参数 276B、激活 12B),采用与 Inkling 相同的架构。
推荐理由:约 1T 参数的开源多模态模型,文章给出多个推理引擎的部署配置和基准对比,便于判断它能否落到现有工作流。
Mistral AI 发布 Robostral Navigate,一个仅用单个 RGB 相机的 8B 具身导航模型,在 R2R-CE validation unseen 上达到 76.6% 成功率。它完全不用 LiDAR 或深度传感器,成绩比最佳单相机方案高 9.7 分,比使用深度或多相机的最佳系统高 4.5 分。模型完全基于仿真数据自研训练,可泛化到轮式、足式与飞行机器人。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可、119B 总参数与 6B 激活参数的形式化验证模型,在 miniF2F 验证集和测试集上均达到 100%。
推荐理由:可对照 Leanstral 1.5 在 PutnamBench 的解题数与约 4 美元单题成本,比较形式化证明模型的性价比。
Google DeepMind 推出图像模型 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与视频生成及对话式编辑模型 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:两款模型同步开放开发者接口并公布延迟与价格数据,便于比较图像与视频生成方案的成本取舍。
Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,把表格预测重构为上下文学习问题,单次前向即可出预测,无需模型训练、超参调优和特征工程。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能在浏览器、移动端和桌面看、推理并执行操作的智能体。
推荐理由:原文交代了 computer use 从独立模型并入 Flash 主模型这一变化,以及配套的两项企业安全护栏。
Mistral 发布 OCR 4 文档解析模型,在文本提取之外新增边界框、块类型分类和逐页逐词置信度,支持 170 种语言并可单容器自托管部署。该模型在 OlmOCRBench 得 85.20、OmniDocBench 得 93.07,人类偏好评估中平均胜率 72%。
推荐理由:OCR 4 把边界框、块分类和置信度一并输出,读者可据此判断结构化文档解析在检索与智能体流程里的接入方式。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:原文说明 DiffusionGemma 与 Gemma 4 的分工,前者面向低并发本地推理,并列出速度与质量上的取舍。
Google 发布 Gemini 3.5 Live Translate 音频模型,支持 70 多种语言的近实时语音到语音翻译,并保留说话人的语调、节奏和音高。
推荐理由:模型在 70 多种语言上连续生成语音,原文区分了它与逐句翻译系统的取舍,并列出开发者、企业和普通用户各自的接入入口。
Google DeepMind 发布 Gemma 4 12B,一款无编码器的多模态模型,可在笔记本本地运行。该模型把视觉输入改为单次矩阵乘法的轻量嵌入模块,并去掉音频编码器,将原始音频信号投影到与文本 token 相同的维度,是 Gemma 4 系列首款支持原生音频输入的中等规模模型。
推荐理由:Gemma 4 12B 用无编码器架构让视觉和音频直接进入 LLM,性能接近 26B MoE 而内存占用不到一半。
Mistral 发布 Mistral Medium 3.5,这是一个 128B 稠密模型,以开源权重、修改版 MIT 许可发布,并成为 Mistral Vibe 和 Le Chat 的默认模型。
推荐理由:把编码智能体迁到云端并以 128B 开源权重模型驱动,读者可据此判断自托管部署与异步并行任务的成本变化。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成视频,并用自然语言多轮对话编辑视频。
推荐理由:原文给出了新模型的多模态输入与对话式视频编辑能力,读者可据此判断它在现有视频生成工作流中的位置。
Google DeepMind 的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度为 80%,三天前升至接近 100%,这也是首次从一级风速起步成功预测风暴增强到五级。
推荐理由:原文以飓风 Melissa 为例,交代 AI 天气模型在快速增强预报上的实际表现,以及传统模型在路径与强度间的取舍。
Google DeepMind 发布 Gemini 3.5 模型系列,首个版本 3.5 Flash 今天起在 Gemini 应用、Google Search 的 AI Mode、Google Antigravity 和 Gemini API 开放,3.5 Pro 已在内部使用并计划下月推出。
推荐理由:原文用 Terminal-Bench 2.1、MCP Atlas 等基准与 4 倍输出速度做横向对比,读者可据此判断速度与智能体能力能否兼得。
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,在 Artificial Analysis TTS 榜单上取得 1,211 的 Elo 分数,并被列入最具吸引力象限。
推荐理由:官方给出音频标签的具体用法与 70+ 语言覆盖,读者可据此判断可控语音合成的可用场景。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这款面向机器人的推理模型增强了空间推理与多视角理解,并新增仪表读数能力。官方称其在指向、计数和任务成功检测上相比 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 有明显提升。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。
推荐理由:原文列出四档尺寸、Arena 排名与 Apache 2.0 许可,便于判断本地部署和微调的硬件与授权取舍。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,已通过 API 提供,定价 $0.016 / 1k 字符。
推荐理由:官方给出了 4B 模型在 9 种语言上的延迟、单价以及和 ElevenLabs 的人评对比口径,便于判断语音 Agent 的选型与成本。
Mistral AI 发布 Mistral Small 4,称其是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的编码智能体能力统一进单一模型的 Mistral 模型,以 Apache 2.0 许可开源。
推荐理由:Mistral Small 4 把推理、多模态与编码能力合进一个开源模型,读者可据此评估单模型替代多模型组合的部署取舍。
Mistral 发布 Leanstral,首个面向 Lean 4 的开源代码智能体,Apache 2.0 开源并提供免费 API。该模型激活参数 6B,采用稀疏架构,支持任意 MCP,并针对 lean-lsp-mcp 训练,也可在 Mistral vibe 的 agent 模式中使用。
Mistral 发布 Voxtral Transcribe 2 系列两款语音转写模型,包括用于批处理的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,后者以 Apache 2.0 权重在 Hugging Face 开源。
推荐理由:Realtime 以 sub-200ms 延迟和 Apache 2.0 权重开源,读者可据此比较实时语音应用的端侧落地成本。