跳到正文

#模型发布

今日 3 条
今天9月30日周三
  1. AWS Machine Learning Blog67

    GPT-6.1 Sol 在 Amazon Bedrock 上正式可用

    GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,面向智能体编码、计算机操作和专业工作负载提供更强推理。

    推荐理由:文章给出 GPT-6.1 Sol 与 Astra、GPT-6 Sol 的评测及单任务成本对比,可据此评估智能体编码任务的性价比。

  2. OpenAI News62

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,面向编码、计算机操作和专业工作场景,官方称其智能水平接近 Astra。该模型的 API 输入与输出 token 价格均为 Astra 标准价的五分之一。

    推荐理由:官方给出 GPT-6.1 Sol 相对 Astra 的 token 定价比例与能力定位,可用于判断其成本取舍。

9月28日周一
9月23日周三
  1. AWS Machine Learning Blog67

    GPT-6 Sol 与 GPT-6 Luna 在 Amazon Bedrock 正式可用

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 在 Amazon Bedrock 正式可用,API 定价显著低于 GPT-5.6 前代。GPT-6 Sol 面向开发与运维中反复出现的复杂任务,GPT-6 Luna 面向大批量重复任务,两者都支持显式提示词缓存。OpenAI 的内部事实性评测显示,GPT-6 Sol 的事实性错误约为 GPT-5.6 Sol 的一半。

    推荐理由:两款模型按复杂任务与高频任务分层,API 定价低于 GPT-5.6 前代,可据此判断日常负载的选型。

  2. OpenAI:官网动态64

    OpenAI 发布 GPT-6 Sol 和 Luna 两款模型

    OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,称它们把前沿智能带入日常工作,区别在于能力与成本的不同平衡。

    推荐理由:OpenAI 一次发布两款模型并给出能力与成本的不同取舍,读者可据此比较它们在日常工作场景中的定位。

9月16日周三
9月12日周六
9月10日周四
  1. OpenAI:官网动态68

    OpenAI 在 API 中上线 GPT-Live-1,支持全双工语音对话

    OpenAI 将 GPT-Live-1 引入 API,为开发者带来自然的全双工语音对话能力。该模型具备更强的指令遵循能力,支持自定义音色,并提供电话(telephony)支持。

    推荐理由:原文给出 GPT-Live-1 在 API 中的全双工语音、自定义音色与电话接入能力,可据此判断语音应用的接入变化。

9月9日周三
  1. OpenAI:官网动态63

    OpenAI 发布 GPT-6 Astra,面向企业场景的最强模型

    OpenAI 发布 GPT-6 Astra,称其为企业场景下能力最强的模型,具备进阶推理、computer use 以及更强的写作与设计判断能力。官方目前只给出能力方向,未披露评测数据、定价与开放时间。

    推荐理由:官方给出 GPT-6 Astra 面向企业场景的定位与能力方向,可作为观察工作型模型演进的一手参考。

9月3日周四
  1. OpenAI:官网动态64

    OpenAI 发布 GPT-6 Astra 新一代模型

    OpenAI 发布 GPT-6 Astra,称其为目前最智能、对齐程度最高的模型,在计算机操作、编码、网络安全和科学等方向具备 SOTA 能力。官方摘要未给出参数规模、上下文窗口或开放时间等细节。

    推荐理由:OpenAI 公布 GPT-6 Astra 在计算机操作、编码、网络安全与科学方向的能力覆盖,读者可据此了解新模型的定位。

9月1日周二
8月28日周五
  1. Google DeepMind62

    Google DeepMind 发布 Gemini Omni 1.1 Flash,新增场景扩展、首尾帧插值与 4K 放大

    Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景扩展、首尾帧插值、360p 快速草稿和最高 4K 放大等生成式视频能力,已通过 Gemini API 在 Google AI Studio 上线。

    推荐理由:相较于此前只参考最后一秒,Omni 1.1 把场景扩展的前序上下文提高到 10 秒,便于评估长视频工作流的可行性。

8月27日周四
8月25日周二
8月21日周五
8月14日周五
8月12日周三
  1. Google DeepMind72

    Google DeepMind 发布手语转文本模型 SL2T,Gboard 与 Live Transcribe 在 Pixel 11 上线 ASL 听写

    Google DeepMind 发布多语言手语转文本模型 SL2T,并在 Gboard 与 Live Transcribe 中上线手语听写功能,先在 Pixel 11 上支持美国手语(ASL)转英文。

    推荐理由:SL2T 用 10 万小时、50 多种手语数据训练并直接落到 Gboard 与 Live Transcribe,可作为手语翻译产品化的参考。

8月11日周二
  1. HuggingFace Blog54

    NVIDIA 发布 Magpie TTS 多语言模型,扩展至 12 种语言

    NVIDIA 发布 Magpie TTS Multilingual,一款 364M 参数的开放权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。官方数据显示 B200 单流首音频延迟 32ms,64 并发流下 TTFA 239ms、吞吐约 320 倍实时。模型提供 Hugging Face 开放权重与 NVIDIA NIM 生产部署,并可用 NeMo 微调发音和音色。

8月10日周一
  1. HuggingFace Blog79

    Meta 发布开源多模态模型 Muse Glimmer,30B 参数主打本地智能体

    Meta 发布开源多模态模型 Muse Glimmer,30B 参数、Apache 2.0 许可,面向本地智能体场景。模型由 2B 视觉编码器与 28B 文本解码器组成,并附带 DFlash 投机解码草稿模型,transformers、llama.cpp、vLLM 与 Inference Endpoints 均已提供 day-0 支持。

    推荐理由:30B 多模态模型以 Apache 2.0 开放并在多智能体基准上与同级模型对比,可供本地部署的选型参考。

8月6日周四
  1. Google DeepMind79

    Google DeepMind 开源 WeatherNext 气旋预测模型,预警可多出一天

    Google DeepMind 的 WeatherNext AI 模型在气旋路径、强度和风场结构预测上达到当前最优精度,平均为预报员多争取约一天的有效提前量,成果发表在 Nature。

    推荐理由:原文给出气旋路径与强度预测的领先幅度,并公开模型权重与代码,可对照传统预报方法理解改进来源。

8月4日周二
7月30日周四
  1. Google DeepMind61

    Google DeepMind 发布 Gemini Robotics ER 2 机器人具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,负责与人类对话、理解物理世界并规划多步任务,再把运动执行交给底层 VLA 模型。

    推荐理由:官方给出 Gemini Robotics ER 2 相比 ER 1.6 和前沿模型在进度分类、时刻定位上的指标,读者可据此判断机器人具身推理的当前水平。

  2. Google DeepMind48

    Google 在 Google Flow Music 发布 Lyria 3.5,升级音乐性、歌词、人声与创作控制

    Google 在 Google Flow Music 上线最新音乐生成模型 Lyria 3.5,在音乐性、歌词、人声和创作控制四方面均有提升。新模型可生成更丰富复杂的旋律结构,歌词质量更高且提示词遵循与结构感知更好,人声更具表现力与情感、发音更准确。用户还可更便捷地控制输出节奏与时长,即日起可试用。

7月28日周二
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能

    Google DeepMind 发布 Gemini Robotics 2,由三款模型组成,让机器人实现全身控制、灵巧操作和多机器人协作。其中 Gemini Robotics ER 2 已上线 Google AI Studio 并在 Gemini Enterprise Agent Platform 私密预览,VLA 与端侧模型面向早期接入合作伙伴。

    推荐理由:从控制机器人上半身扩展到全身控制,并加入多机协作与端侧快速适配,可了解机器人基础模型的当前能力边界。

7月27日周一
7月21日周二
7月17日周五
  1. Google DeepMind61

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 轻量网络安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 构建并微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等评测中与体量大得多的模型表现相当。

    推荐理由:原文给出该模型在 CyberGym、Chrome 产线扫描等评测中的对比数据,以及仅面向政府和可信伙伴的试点开放方式。

7月15日周三
  1. HuggingFace Blog79

    Thinking Machines 发布开源多模态模型 Inkling 及 Inkling-Small

    Thinking Machines 发布开源多模态模型 Inkling,总参数 975B、激活 41B,支持 1M 上下文并原生接收图像、音频和文本输入。同期推出 Inkling-Small(总参数 276B、激活 12B),采用与 Inkling 相同的架构。

    推荐理由:约 1T 参数的开源多模态模型,文章给出多个推理引擎的部署配置和基准对比,便于判断它能否落到现有工作流。

7月8日周三
  1. Mistral AI49

    Mistral AI 发布 Robostral Navigate:8B 具身导航模型

    Mistral AI 发布 Robostral Navigate,一个仅用单个 RGB 相机的 8B 具身导航模型,在 R2R-CE validation unseen 上达到 76.6% 成功率。它完全不用 LiDAR 或深度传感器,成绩比最佳单相机方案高 9.7 分,比使用深度或多相机的最佳系统高 4.5 分。模型完全基于仿真数据自研训练,可泛化到轮式、足式与飞行机器人。

7月2日周四
7月1日周三
6月30日周二
6月23日周二
  1. Mistral AI63

    Mistral 发布 OCR 4 文档解析模型,支持边界框与块分类

    Mistral 发布 OCR 4 文档解析模型,在文本提取之外新增边界框、块类型分类和逐页逐词置信度,支持 170 种语言并可单容器自托管部署。该模型在 OlmOCRBench 得 85.20、OmniDocBench 得 93.07,人类偏好评估中平均胜率 72%。

    推荐理由:OCR 4 把边界框、块分类和置信度一并输出,读者可据此判断结构化文档解析在检索与智能体流程里的接入方式。

6月11日周四
6月9日周二
  1. Google DeepMind77

    Google DeepMind 发布 Gemma 4 12B 无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款无编码器的多模态模型,可在笔记本本地运行。该模型把视觉输入改为单次矩阵乘法的轻量嵌入模块,并去掉音频编码器,将原始音频信号投影到与文本 token 相同的维度,是 Gemma 4 系列首款支持原生音频输入的中等规模模型。

    推荐理由:Gemma 4 12B 用无编码器架构让视觉和音频直接进入 LLM,性能接近 26B MoE 而内存占用不到一半。

5月22日周五