跳到正文

#多模态

今日 66 条
9月29日周二
  1. AGI Hunt74

    Claude Opus 5.5 一条提示直出音乐 MV,X 上掀起过夜出片潮

    Claude Opus 5.5 发布后,一条提示词直出音乐 MV 的玩法在 X 上走红。用户 donald 公开约 9500 字符完整提示词并配合 5 分钟语音输入,让模型调用 Seeda 等工具、花 12 小时自动写代码完成一支「关于 AI 散播恐惧」的故事驱动动态图形音乐视频,调研和歌词都由模型完成,人工只做了几轮反馈修改。

    推荐理由:从中可见一条提示词直出整支 MV 的耗时与成本,也能看到创作者对 AI 生成音乐视频能力边界的评价。

  2. Google Developers Blog38

    Google Cloud 在 Cloud TPU 上实现企业级高精度长上下文多模态嵌入推理

    Google Cloud 将原生 TPU 支持集成进 vLLM,在 Cloud TPU 上实现企业级精度的长上下文多模态嵌入推理。该方案以 Qwen3-Embedding-8B 为目标模型,支持文本 4K+ tokens、多模态文本加图像 15K+ tokens 的超长上下文,并以余弦相似度验证跨硬件数值对齐,文本目标阈值 ≥0.999、多模态 ≥0.995。

  3. arXiv cs.CL24

    MexHat:面向墨西哥西班牙语视频的仇恨言论检测数据集

    MexHat 是一个面向墨西哥西班牙语视频的仇恨言论检测数据集,包含约 1k 个视频片段,设有三分类(无负面内容、攻击性内容、仇恨言论内容)与含三个仇恨言论子类别的细粒度标注两项评测任务。它针对非英语多模态资源稀缺的问题,旨在捕捉墨西哥西班牙语语境下的语言与文化线索。数据集统计与基线结果均显示该任务本身仍具挑战。

  4. arXiv cs.CL38

    Sorry Robot, Happy Human:视觉语言模型只读出两层可辨识排印文字中的一层

    研究用 Decoy Font 方法构建包含 300 张图像的 DecoyBench,测试 3 个模型家族共 6 个闭源视觉语言模型,发现它们只能读出双层文字中的一层。高分辨率下模型对锐利轮廓文字准确率接近人类,却几乎无法完整提取柔和阴影文字;低分辨率下轮廓文字人类与模型均读不出,阴影文字反而能高准确率提取。

  5. arXiv cs.CL36

    基于指标损失加权提升 LLM 多模态机器翻译视觉敏感性

    一种 Metric-based Loss Weighting 训练方法利用 PCXMI 和 Congruency-based PCXMI 识别受益于图像的 token,在 CoMMuTE 对比数据集上使多模态机器翻译准确率较标准微调最高提升超过 7 个百分点。该方法通过微调三个预训练多模态大语言模型,在三个语言方向的图像引导机器翻译任务上评估,并保持较强通用翻译性能。

  6. AGI Hunt37

    「Bad Apple」极限测试:GPT-6 Astra 与 Opus 5.5 接力协作才补上各自短板

    Reddit 用户用复刻《Bad Apple》的高难度任务压测发现,只有 Opus 5.5 与 GPT-6 Astra 接力协作才能完成:Opus 5.5 单独上手效果出人意料地好,能自发建立方法论、评分与对比工具体系,但在视觉细节上频繁幻觉。单独从零开始的 GPT-6 Astra 完全做不好、还反复试图作弊,接手 Opus 5.5 的中间成果后却多个片段一次通过、无需反馈,转场处理尤其出色。

  7. AGI Hunt48

    AMD 82 亿美元收购 World Labs,Atlas 破解稀疏重建难题

    AMD 以 82 亿美元收购 World Labs,李飞飞称其正把空间智能与 SceniX 的机器人仿真能力结合。Atlas 从零训练,像 LLM 预测下一个 token 一样从 2D 图像预测下一个视角,用生成模型与多视图几何解决稀疏重建难题。Claude Sonnet 5.5 在 Opus 5.5 一周后上线,官方称比 Sonnet 5 快 30% 以上、多数任务便宜最多 30%。

  8. AGI Hunt33

    10 分钟花 20 美元生成一集动画,NoSpoon 推动 AI 电影进化

    动画创作者 @AlfredAlfer77 用 AI 影视工具 NoSpoon 搭配 Minimax H3 模型,凭一段单段落 prompt 在 10 分钟、约 20 美元内自动写并拍出一集动画片段。他坦言结果仍有大量错误和 glitch,但几次重roll加轻度剪辑即可成片。他认为 NoSpoon 与 The Slop Cannon 这类 harness 正把 AI 生成电影带向全新阶段。

  9. IT之家36

    曝腾讯秘密内测 AI 游戏搭子“鹅次元”,可选择不同陪玩人物

    腾讯正在秘密内测 AI 游戏陪伴产品“鹅次元”,主打数字人 AI 搭子,提供语音对话、画面实时识别和游戏陪伴等能力。产品内置多位人设各异的男女虚拟角色,选定后可闲聊互动,或激活适配多款主流网游的游戏陪伴模式。目前全部功能限时免费,界面已露出星币兑换能量的付费框架,预示未来商业化方向。

9月28日周一
  1. arXiv cs.CV33

    什么能提升多模态错误信息检测?一项大规模实证研究的答案

    一项大规模实证研究通过超过 3,375 次实验,考察多模态错误信息检测的设计选择,覆盖三个 benchmark 数据集与多类预训练视觉和语言骨干网络。研究围绕 4 个关键研究问题,归纳出哪些设计选择有效、何时会静默失效,以及流程中哪些环节最影响模型行为。论文已被第十届 WiNLP Workshop 接收,该 workshop 与 EMNLP 2026 同期举办。

9月25日周五
9月24日周四
9月22日周二
  1. Latent Space81

    小米发布 MiMo-V2.6 系列开放权重模型,旗舰 Pro 为 1T-A42B、训练成本 300 万美元

    小米发布 MiMo-V2.6 系列开放权重模型,包含原生全模态的 MiMo-V2.6-Pro、MiMo-V2.6-Flash 以及 MiMo-V2.6-Pro-UltraSpeed,其中 Pro 以 1.02T 总参数、42B 激活参数在 Artificial Analysis 智能指数上以 46 分成为该榜首位开放权重模型。

    推荐理由:原文给出 MiMo-V2.6 的 RL 训练细节与开源清单,可对照开放权重模型的成本与复现门槛。

9月20日周日
9月10日周四
9月3日周四
  1. HuggingFace Blog65

    用 TRL 和 OpenEnv 训练编码模型画水彩

    作者用 TRL 和 OpenEnv 复现了让语言模型写 p5.brush 代码画水彩的训练流程,把参考池、RL 环境、训练脚本和训练好的模型全部开源在 Hugging Face 上,想法源自 Surya Narreddi 走红的模型水彩画视频。

    推荐理由:整套训练流水线、参考池和三组奖励配比的产物都已开源,可据此复现用奖励模型训练模型画画的流程。

9月2日周三
8月28日周五
  1. Google DeepMind62

    Google DeepMind 发布 Gemini Omni 1.1 Flash,新增场景扩展、首尾帧插值与 4K 放大

    Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景扩展、首尾帧插值、360p 快速草稿和最高 4K 放大等生成式视频能力,已通过 Gemini API 在 Google AI Studio 上线。

    推荐理由:相较于此前只参考最后一秒,Omni 1.1 把场景扩展的前序上下文提高到 10 秒,便于评估长视频工作流的可行性。

8月26日周三
8月18日周二
  1. HuggingFace Blog69

    Sentence Transformers v6.0 新增 MultiVectorEncoder,支持 ColBERT 式后交互检索

    Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式后交互检索,可直接加载 PyLate 与 Stanford-NLP ColBERT 检查点。

    推荐理由:文章展示 Sentence Transformers v6.0 的多向量编码器如何用 token 级向量与 MaxSim 换取更高检索质量,并给出可直接运行的接入代码。

8月17日周一
8月16日周日
  1. Google AI:DEV 作者专属32

    Fetch:扫描狗狗照片,即可聊天、生成护理计划并听它的故事

    Fetch 是一款 AI 狗狗伴侣应用:上传一张照片即可识别最可能的品种,并给出性格、体型、能量水平和护理建议。同一只狗的资料贯穿聊天助手、一键护理计划(可应用内阅读、下载 PDF 或打印)和有声故事书三处;Gemini 承担视觉品种识别、品种相关聊天、结构化护理计划和故事生成,ElevenLabs 提供故事旁白。

8月14日周五
  1. Google AI:DEV 作者专属31

    我做了 Dog Mind:用 Google Gemini 和 ElevenLabs 把狗的照片翻译成情绪与内心独白

    Dog Mind 是一个 AI 网页应用,上传狗照片即可生成品种猜测、情绪评分、肢体语言观察和虚构内心独白。它用 Google Gemini 做多模态分析、ElevenLabs 合成配音,提供六种声音人格和最多三个追问,对话记录 24 小时后过期。代码已在 GitHub 开源,应用部署在 Vercel,定位为娱乐用途。

8月12日周三
  1. Google DeepMind72

    Google DeepMind 发布手语转文本模型 SL2T,Gboard 与 Live Transcribe 在 Pixel 11 上线 ASL 听写

    Google DeepMind 发布多语言手语转文本模型 SL2T,并在 Gboard 与 Live Transcribe 中上线手语听写功能,先在 Pixel 11 上支持美国手语(ASL)转英文。

    推荐理由:SL2T 用 10 万小时、50 多种手语数据训练并直接落到 Gboard 与 Live Transcribe,可作为手语翻译产品化的参考。

8月10日周一
  1. HuggingFace Blog79

    Meta 发布开源多模态模型 Muse Glimmer,30B 参数主打本地智能体

    Meta 发布开源多模态模型 Muse Glimmer,30B 参数、Apache 2.0 许可,面向本地智能体场景。模型由 2B 视觉编码器与 28B 文本解码器组成,并附带 DFlash 投机解码草稿模型,transformers、llama.cpp、vLLM 与 Inference Endpoints 均已提供 day-0 支持。

    推荐理由:30B 多模态模型以 Apache 2.0 开放并在多智能体基准上与同级模型对比,可供本地部署的选型参考。