Claude Opus 5.5 还原《戴珍珠耳环的少女》创作瞬间,网友直呼动人
视频博主 EHuanglu 用 Claude Opus 5.5 生成了一段想象《戴珍珠耳环的少女》被创作那一刻的视频,画面被认为真实而动人,获得包括 justin_hart 在内的多人转发称赞。
视频博主 EHuanglu 用 Claude Opus 5.5 生成了一段想象《戴珍珠耳环的少女》被创作那一刻的视频,画面被认为真实而动人,获得包括 justin_hart 在内的多人转发称赞。
字节 Seedream 5.0 Flash 已在 Runware 平台上线,主打高吞吐量图片编辑,价格为每张输出图片 $0.019 起。该模型最多可用 10 张参考图进行编辑,能将一张图分解为最多 16 层 PNG 图层,并支持通过精确的 prompt 坐标定位做局部编辑。
Microsoft Research 与 Broad Institute 合作推出面向生物学的多模态世界模型 Quine,联合训练基因组、蛋白质、化学、RNA/细胞状态与生物成像等跨尺度表征,一个模态的证据可支撑另一模态的预测,并配有连接模型、科学工具、文献与湿实验的交互式 harness。
博主 FinanceYF5 用同一条提示词对比 Opus 5.5 的 Max effort 与 Grok 4.7 Fast 的 xhigh effort 生成动态图形视频:提示词要求制作一段 15 秒的动感动态图形视频,展示其作为顶级动态设计师的实力。两条视频可对照看两家模型在动态图形生成上的风格与质量差异。
Claude Opus 5.5 发布后,一条提示词直出音乐 MV 的玩法在 X 上走红。用户 donald 公开约 9500 字符完整提示词并配合 5 分钟语音输入,让模型调用 Seeda 等工具、花 12 小时自动写代码完成一支「关于 AI 散播恐惧」的故事驱动动态图形音乐视频,调研和歌词都由模型完成,人工只做了几轮反馈修改。
推荐理由:从中可见一条提示词直出整支 MV 的耗时与成本,也能看到创作者对 AI 生成音乐视频能力边界的评价。
博主 FinanceYF5 分享一段号称 100% 由 AI 生成的视频,只用一条提示词、全程无剪辑,真实感已难分辨真假,展示 Kling 4.0 在视频生成上的写实能力。类似演示此前由 @minchoi 首发并引发关注。
Kling 4.0 仅凭一条提示词、全程无剪辑生成 100% 由 AI 生成的视频,其真实感被认为已难分辨真假。该演示来自 @minchoi,由博主 FinanceYF5 转引,为同一演示的转发版本。
Roboflow 发布长文评测称 GPT-6 Astra 是其测试过的最强视觉模型,在 Roboflow Vision Evals 目标检测任务上低推理档位即达 82.1% mAP@50,领先 Qwen3.8 Max 5.4 分、领先 GPT-5.6 Sol 13.7 分。
Claude Opus 5.5 以 88.4% 领跑 SimpleBench,推理强度提到 xhigh 时 Terminal-Bench-Science 由 24% 升至 62%,但 max 反降到 59%。它被评为 Anthropic 史上最佳视觉模型,成本比 Fable 5.1 低约 60%。Opus 5.5 与 GPT-6 Astra 还能纯用代码生成视频动画。
Reddit 用户用复刻《Bad Apple》的高难度任务压测发现,只有 Opus 5.5 与 GPT-6 Astra 接力协作才能完成:Opus 5.5 单独上手效果出人意料地好,能自发建立方法论、评分与对比工具体系,但在视觉细节上频繁幻觉。单独从零开始的 GPT-6 Astra 完全做不好、还反复试图作弊,接手 Opus 5.5 的中间成果后却多个片段一次通过、无需反馈,转场处理尤其出色。
小米发布 MiMo-V2.6 系列开放权重模型,包含原生全模态的 MiMo-V2.6-Pro、MiMo-V2.6-Flash 以及 MiMo-V2.6-Pro-UltraSpeed,其中 Pro 以 1.02T 总参数、42B 激活参数在 Artificial Analysis 智能指数上以 46 分成为该榜首位开放权重模型。
推荐理由:原文给出 MiMo-V2.6 的 RL 训练细节与开源清单,可对照开放权重模型的成本与复现门槛。
NeoMME 发布,这是一个包含 260M 和 800M 两个版本的多语言多模态编码器家族,用单个双向 Transformer 同时处理文本 token 和原始图像 patch,不依赖预训练视觉塔或因果语言模型。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景扩展、首尾帧插值、360p 快速草稿和最高 4K 放大等生成式视频能力,已通过 Gemini API 在 Google AI Studio 上线。
推荐理由:相较于此前只参考最后一秒,Omni 1.1 把场景扩展的前序上下文提高到 10 秒,便于评估长视频工作流的可行性。
Google DeepMind 发布多语言手语转文本模型 SL2T,并在 Gboard 与 Live Transcribe 中上线手语听写功能,先在 Pixel 11 上支持美国手语(ASL)转英文。
推荐理由:SL2T 用 10 万小时、50 多种手语数据训练并直接落到 Gboard 与 Live Transcribe,可作为手语翻译产品化的参考。
Meta 发布开源多模态模型 Muse Glimmer,30B 参数、Apache 2.0 许可,面向本地智能体场景。模型由 2B 视觉编码器与 28B 文本解码器组成,并附带 DFlash 投机解码草稿模型,transformers、llama.cpp、vLLM 与 Inference Endpoints 均已提供 day-0 支持。
推荐理由:30B 多模态模型以 Apache 2.0 开放并在多智能体基准上与同级模型对比,可供本地部署的选型参考。
Mistral AI 发布 3B 开源多模态安全分类器 Shieldstral,以 Apache 2.0 开放权重,可在单张 16GB NVIDIA GPU 上运行。
推荐理由:Mistral 把内容审核改写成推理时的自然语言问答,给出了小模型适配新策略的可迁移做法。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,负责与人类对话、理解物理世界并规划多步任务,再把运动执行交给底层 VLA 模型。
推荐理由:官方给出 Gemini Robotics ER 2 相比 ER 1.6 和前沿模型在进度分类、时刻定位上的指标,读者可据此判断机器人具身推理的当前水平。
Google 在 Google Flow Music 上线最新音乐生成模型 Lyria 3.5,在音乐性、歌词、人声和创作控制四方面均有提升。新模型可生成更丰富复杂的旋律结构,歌词质量更高且提示词遵循与结构感知更好,人声更具表现力与情感、发音更准确。用户还可更便捷地控制输出节奏与时长,即日起可试用。
Google DeepMind 发布 Gemini Robotics 2,由三款模型组成,让机器人实现全身控制、灵巧操作和多机器人协作。其中 Gemini Robotics ER 2 已上线 Google AI Studio 并在 Gemini Enterprise Agent Platform 私密预览,VLA 与端侧模型面向早期接入合作伙伴。
推荐理由:从控制机器人上半身扩展到全身控制,并加入多机协作与端侧快速适配,可了解机器人基础模型的当前能力边界。
NVIDIA 发布 Cosmos-H-Dreams,一款面向手术机器人的实时、动作条件生成式模拟器,把 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型。
Thinking Machines 发布开源多模态模型 Inkling,总参数 975B、激活 41B,支持 1M 上下文并原生接收图像、音频和文本输入。同期推出 Inkling-Small(总参数 276B、激活 12B),采用与 Inkling 相同的架构。
推荐理由:约 1T 参数的开源多模态模型,文章给出多个推理引擎的部署配置和基准对比,便于判断它能否落到现有工作流。
Mistral AI 发布 Robostral Navigate,一个仅用单个 RGB 相机的 8B 具身导航模型,在 R2R-CE validation unseen 上达到 76.6% 成功率。它完全不用 LiDAR 或深度传感器,成绩比最佳单相机方案高 9.7 分,比使用深度或多相机的最佳系统高 4.5 分。模型完全基于仿真数据自研训练,可泛化到轮式、足式与飞行机器人。
Google DeepMind 推出图像模型 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与视频生成及对话式编辑模型 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:两款模型同步开放开发者接口并公布延迟与价格数据,便于比较图像与视频生成方案的成本取舍。
Mistral 发布 OCR 4 文档解析模型,在文本提取之外新增边界框、块类型分类和逐页逐词置信度,支持 170 种语言并可单容器自托管部署。该模型在 OlmOCRBench 得 85.20、OmniDocBench 得 93.07,人类偏好评估中平均胜率 72%。
推荐理由:OCR 4 把边界框、块分类和置信度一并输出,读者可据此判断结构化文档解析在检索与智能体流程里的接入方式。
Google DeepMind 发布 Gemma 4 12B,一款无编码器的多模态模型,可在笔记本本地运行。该模型把视觉输入改为单次矩阵乘法的轻量嵌入模块,并去掉音频编码器,将原始音频信号投影到与文本 token 相同的维度,是 Gemma 4 系列首款支持原生音频输入的中等规模模型。
推荐理由:Gemma 4 12B 用无编码器架构让视觉和音频直接进入 LLM,性能接近 26B MoE 而内存占用不到一半。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成视频,并用自然语言多轮对话编辑视频。
推荐理由:原文给出了新模型的多模态输入与对话式视频编辑能力,读者可据此判断它在现有视频生成工作流中的位置。
Google DeepMind 发布 Gemini 3.5 模型系列,首个版本 3.5 Flash 今天起在 Gemini 应用、Google Search 的 AI Mode、Google Antigravity 和 Gemini API 开放,3.5 Pro 已在内部使用并计划下月推出。
推荐理由:原文用 Terminal-Bench 2.1、MCP Atlas 等基准与 4 倍输出速度做横向对比,读者可据此判断速度与智能体能力能否兼得。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。
推荐理由:原文列出四档尺寸、Arena 排名与 Apache 2.0 许可,便于判断本地部署和微调的硬件与授权取舍。
Mistral AI 发布 Mistral Small 4,称其是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的编码智能体能力统一进单一模型的 Mistral 模型,以 Apache 2.0 许可开源。
推荐理由:Mistral Small 4 把推理、多模态与编码能力合进一个开源模型,读者可据此评估单模型替代多模型组合的部署取舍。
Mistral AI 发布 Mistral OCR 3,称其在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%。
Mistral 发布 Mistral 3 模型家族,包含稀疏 MoE 的 Mistral Large 3(41B 激活、675B 总参数)与三款密集小模型 Ministral 3(3B、8B、14B),全部以 Apache 2.0 开源。
推荐理由:Mistral 3 一并公布参数规模、开源许可与硬件适配方案,读者可据此对照自身部署条件判断选型。
Mistral AI 发布 Mistral Medium 3,称其以每百万 token 输入 $0.4、输出 $2 的定价,在各项基准上达到 Claude Sonnet 3.7 的 90% 或以上。
推荐理由:原文给出对标 Claude Sonnet 3.7 的基准表现与每百万 token 定价,可据此衡量中型模型在企业场景中的成本位置。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升了文本表现和多模态理解,上下文窗口扩展至最高 128k tokens。
推荐理由:官方列出多模态、长上下文与推理速度指标,可对照 Gemma 3、GPT-4o Mini 判断开源小模型的性能位置。
Mistral 发布 Mistral OCR,一款以图像和 PDF 为输入、按顺序交错输出文本与图片的 OCR API,并已成为 Le Chat 文档理解的默认模型。
推荐理由:官方列出与 Google Document AI、Azure OCR、Gemini 等模型的横向基准对比,可用于判断文档解析模型的当前水位。