跳到正文

#多模态

今日 1 条
今天9月30日周三
9月29日周二
  1. AGI Hunt74

    Claude Opus 5.5 一条提示直出音乐 MV,X 上掀起过夜出片潮

    Claude Opus 5.5 发布后,一条提示词直出音乐 MV 的玩法在 X 上走红。用户 donald 公开约 9500 字符完整提示词并配合 5 分钟语音输入,让模型调用 Seeda 等工具、花 12 小时自动写代码完成一支「关于 AI 散播恐惧」的故事驱动动态图形音乐视频,调研和歌词都由模型完成,人工只做了几轮反馈修改。

    推荐理由:从中可见一条提示词直出整支 MV 的耗时与成本,也能看到创作者对 AI 生成音乐视频能力边界的评价。

  2. AGI Hunt37

    「Bad Apple」极限测试:GPT-6 Astra 与 Opus 5.5 接力协作才补上各自短板

    Reddit 用户用复刻《Bad Apple》的高难度任务压测发现,只有 Opus 5.5 与 GPT-6 Astra 接力协作才能完成:Opus 5.5 单独上手效果出人意料地好,能自发建立方法论、评分与对比工具体系,但在视觉细节上频繁幻觉。单独从零开始的 GPT-6 Astra 完全做不好、还反复试图作弊,接手 Opus 5.5 的中间成果后却多个片段一次通过、无需反馈,转场处理尤其出色。

9月22日周二
  1. Latent Space81

    小米发布 MiMo-V2.6 系列开放权重模型,旗舰 Pro 为 1T-A42B、训练成本 300 万美元

    小米发布 MiMo-V2.6 系列开放权重模型,包含原生全模态的 MiMo-V2.6-Pro、MiMo-V2.6-Flash 以及 MiMo-V2.6-Pro-UltraSpeed,其中 Pro 以 1.02T 总参数、42B 激活参数在 Artificial Analysis 智能指数上以 46 分成为该榜首位开放权重模型。

    推荐理由:原文给出 MiMo-V2.6 的 RL 训练细节与开源清单,可对照开放权重模型的成本与复现门槛。

9月3日周四
8月28日周五
  1. Google DeepMind62

    Google DeepMind 发布 Gemini Omni 1.1 Flash,新增场景扩展、首尾帧插值与 4K 放大

    Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景扩展、首尾帧插值、360p 快速草稿和最高 4K 放大等生成式视频能力,已通过 Gemini API 在 Google AI Studio 上线。

    推荐理由:相较于此前只参考最后一秒,Omni 1.1 把场景扩展的前序上下文提高到 10 秒,便于评估长视频工作流的可行性。

8月12日周三
  1. Google DeepMind72

    Google DeepMind 发布手语转文本模型 SL2T,Gboard 与 Live Transcribe 在 Pixel 11 上线 ASL 听写

    Google DeepMind 发布多语言手语转文本模型 SL2T,并在 Gboard 与 Live Transcribe 中上线手语听写功能,先在 Pixel 11 上支持美国手语(ASL)转英文。

    推荐理由:SL2T 用 10 万小时、50 多种手语数据训练并直接落到 Gboard 与 Live Transcribe,可作为手语翻译产品化的参考。

8月10日周一
  1. HuggingFace Blog79

    Meta 发布开源多模态模型 Muse Glimmer,30B 参数主打本地智能体

    Meta 发布开源多模态模型 Muse Glimmer,30B 参数、Apache 2.0 许可,面向本地智能体场景。模型由 2B 视觉编码器与 28B 文本解码器组成,并附带 DFlash 投机解码草稿模型,transformers、llama.cpp、vLLM 与 Inference Endpoints 均已提供 day-0 支持。

    推荐理由:30B 多模态模型以 Apache 2.0 开放并在多智能体基准上与同级模型对比,可供本地部署的选型参考。

8月4日周二
7月30日周四
  1. Google DeepMind61

    Google DeepMind 发布 Gemini Robotics ER 2 机器人具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,负责与人类对话、理解物理世界并规划多步任务,再把运动执行交给底层 VLA 模型。

    推荐理由:官方给出 Gemini Robotics ER 2 相比 ER 1.6 和前沿模型在进度分类、时刻定位上的指标,读者可据此判断机器人具身推理的当前水平。

  2. Google DeepMind48

    Google 在 Google Flow Music 发布 Lyria 3.5,升级音乐性、歌词、人声与创作控制

    Google 在 Google Flow Music 上线最新音乐生成模型 Lyria 3.5,在音乐性、歌词、人声和创作控制四方面均有提升。新模型可生成更丰富复杂的旋律结构,歌词质量更高且提示词遵循与结构感知更好,人声更具表现力与情感、发音更准确。用户还可更便捷地控制输出节奏与时长,即日起可试用。

7月28日周二
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能

    Google DeepMind 发布 Gemini Robotics 2,由三款模型组成,让机器人实现全身控制、灵巧操作和多机器人协作。其中 Gemini Robotics ER 2 已上线 Google AI Studio 并在 Gemini Enterprise Agent Platform 私密预览,VLA 与端侧模型面向早期接入合作伙伴。

    推荐理由:从控制机器人上半身扩展到全身控制,并加入多机协作与端侧快速适配,可了解机器人基础模型的当前能力边界。

7月27日周一
7月15日周三
  1. HuggingFace Blog79

    Thinking Machines 发布开源多模态模型 Inkling 及 Inkling-Small

    Thinking Machines 发布开源多模态模型 Inkling,总参数 975B、激活 41B,支持 1M 上下文并原生接收图像、音频和文本输入。同期推出 Inkling-Small(总参数 276B、激活 12B),采用与 Inkling 相同的架构。

    推荐理由:约 1T 参数的开源多模态模型,文章给出多个推理引擎的部署配置和基准对比,便于判断它能否落到现有工作流。

7月8日周三
  1. Mistral AI49

    Mistral AI 发布 Robostral Navigate:8B 具身导航模型

    Mistral AI 发布 Robostral Navigate,一个仅用单个 RGB 相机的 8B 具身导航模型,在 R2R-CE validation unseen 上达到 76.6% 成功率。它完全不用 LiDAR 或深度传感器,成绩比最佳单相机方案高 9.7 分,比使用深度或多相机的最佳系统高 4.5 分。模型完全基于仿真数据自研训练,可泛化到轮式、足式与飞行机器人。

7月1日周三
6月23日周二
  1. Mistral AI63

    Mistral 发布 OCR 4 文档解析模型,支持边界框与块分类

    Mistral 发布 OCR 4 文档解析模型,在文本提取之外新增边界框、块类型分类和逐页逐词置信度,支持 170 种语言并可单容器自托管部署。该模型在 OlmOCRBench 得 85.20、OmniDocBench 得 93.07,人类偏好评估中平均胜率 72%。

    推荐理由:OCR 4 把边界框、块分类和置信度一并输出,读者可据此判断结构化文档解析在检索与智能体流程里的接入方式。

6月9日周二
  1. Google DeepMind77

    Google DeepMind 发布 Gemma 4 12B 无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款无编码器的多模态模型,可在笔记本本地运行。该模型把视觉输入改为单次矩阵乘法的轻量嵌入模块,并去掉音频编码器,将原始音频信号投影到与文本 token 相同的维度,是 Gemma 4 系列首款支持原生音频输入的中等规模模型。

    推荐理由:Gemma 4 12B 用无编码器架构让视觉和音频直接进入 LLM,性能接近 26B MoE 而内存占用不到一半。

5月18日周一
5月16日周六
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.5 系列,首发 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型系列,首个版本 3.5 Flash 今天起在 Gemini 应用、Google Search 的 AI Mode、Google Antigravity 和 Gemini API 开放,3.5 Pro 已在内部使用并计划下月推出。

    推荐理由:原文用 Terminal-Bench 2.1、MCP Atlas 等基准与 4 倍输出速度做横向对比,读者可据此判断速度与智能体能力能否兼得。

4月3日周五
3月17日周二
  1. Mistral AI73

    Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码智能体能力

    Mistral AI 发布 Mistral Small 4,称其是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的编码智能体能力统一进单一模型的 Mistral 模型,以 Apache 2.0 许可开源。

    推荐理由:Mistral Small 4 把推理、多模态与编码能力合进一个开源模型,读者可据此评估单模型替代多模型组合的部署取舍。

12月17日周三
12月3日周三
5月7日周三
3月17日周一
3月7日周五
  1. Mistral AI67

    Mistral 发布 OCR 模型与 API Mistral OCR

    Mistral 发布 Mistral OCR,一款以图像和 PDF 为输入、按顺序交错输出文本与图片的 OCR API,并已成为 Le Chat 文档理解的默认模型。

    推荐理由:官方列出与 Google Document AI、Azure OCR、Gemini 等模型的横向基准对比,可用于判断文档解析模型的当前水位。