跳到正文

#多模态

今日 66 条
今天9月30日周三
  1. arXiv cs.CV33

    MATE:面向统一多模态模型的互对抗自训练与演化数据框架

    MATE 是基于强化学习的后训练框架,让统一多模态模型的生成与理解分支轮流充当挑战者与求解者、相互对抗。在 Janus-Pro-1B 上,它使 GenEval 提升 2.4 分、DPG-Bench 提升 1.7 分,九个理解基准平均提升 0.7 分。对抗候选来自模型自身输出,无需单独训练对抗器,落败候选转为下一轮挑战,训练在数据空间形成自博弈。

  2. arXiv cs.CV34

    LeRF:为视角转换推理学习参考坐标系

    LeRF 框架让 VLM 学会构建并使用显式参考坐标系做视角转换推理。模型先判断是否需要坐标系,再定位参考实体并预测坐标系原点与以实体为中心的参考坐标系,由轻量渲染器叠加到图像上,无需外部感知模型或显式 3D 重建。训练先监督微调、再用空间 VQA 数据强化学习,在多个视角转换 benchmark 上优于骨干模型,坐标系定位与朝向估计亦有提升。

  3. arXiv cs.CL25

    面向韩语发票信息提取的 OCR 模型开发

    面向韩语发票信息提取的 OCR 模型将深度学习模型与图像预处理技术结合,在收集的发票数据集上达到 87% F1-score,且处理耗时几乎可忽略。该模型用于自动抽取发票中的购买商品、时间和总金额等信息;韩语是约 8000 万人的母语,在越南、菲律宾等地有大量韩国企业,发票信息自动提取需求明确。

  4. arXiv cs.CV33

    从锐利之眼到专家之脑:MLLM 内化专家知识用于篡改文本检测

    EKI 是一个两阶段框架,把取证专家的细粒度感知能力内化进 MLLM,用于篡改文本检测。Stage 1 用 Text-Focused 与 Image-Focused 策略聚焦小文字区域,Stage 2 通过 FGRA 损失对齐浅层 LLM 表征与预训练取证专家。EKI 在多个域内与跨域 benchmark 上取得 SOTA 和更强泛化,专家只在训练时需要,推理效率与原始模型几乎一致。

  5. arXiv cs.CV40

    同一几何,不同结果:CLIP 与 SigLIP 中模态间隙的读出依赖效应

    在 CLIP 与 SigLIP 编码器中,单一主方向承载图文均值分离平方范数的 94.4-99.9%,说明该分离分量近似秩一。分解相似度分数后,间隙在零样本分类中相当于加性类别偏置,在标准跨模态检索中投影掉间隙方向会丢弃候选特定范数信息、造成乘性排序扭曲。几何推导出的指数与网格搜索最优值 Spearman rho = 0.93,可在部分设置下恢复性能,但增益转移不均。

  6. arXiv cs.CV35

    AerialDojo-200K:面向开放世界空中目标搜索的大规模基准套件

    研究提出面向开放世界空中目标搜索的大规模基准套件 AerialDojo-200K,其场景数与任务实例数分别达现有最大同类基准的 3 倍和 18.7 倍。该套件含 42 个仿真场景和 205,732 个任务实例,并提供 21 个分布内与 21 个分布外场景的统一评测框架。对 5 个开源和 4 个闭源多模态大语言模型的评测显示,通用空中智能体仍有很长的路要走。

  7. arXiv cs.CV42

    系统性多智能体视觉语言导航:形式化、MAVLN 基准与 TRISS 方法

    作者称首次将多智能体 VLN 形式化为带依赖与资源约束的协同问题,并发布 MAVLN 基准与 TRISS 协作导航系统。MAVLN 含 11,724 条 episode、145 个场景,覆盖最多四个智能体与三种指令设定,配套约束感知指标。TRISS 由基于 LLM 的子任务调度器、共享拓扑记忆与冲突感知执行机制构成,实验显示其可作为综合基线,调度、规划与执行仍有较大提升空间。

  8. AGI Hunt46

    雅虎前 CEO Marissa Mayer 发布 AI 助手 Dazzle

    雅虎前 CEO、前 Google 高管 Marissa Mayer 于 9 月 30 日发布个人 AI 助理 Dazzle。该产品读取手机相册,从服装、旅行、夜出行等照片中理解用户偏好,实现个性化购物推荐与代理购物,并把手机相机按钮变成无需输入提示词的「搞定」按钮,直接基于当前画面提供即时上下文与操作。

  9. AGI Hunt35

    FurE:无需动物毛发数据集的实例级 3D 毛发重建,训练提速 10 倍

    FurE 提出一种无需动物毛发数据集的实例级 3D 毛发重建方法,可从多视角图像恢复逐根可编辑的动物毛发。它优化根条件隐场,用基于人类头发数据训练的 PCA 解码器解码为发丝几何以绕开动物数据稀缺,并结合表面约束的 Gaussian Frosting 重建去毛后的身体。相比当前 SOTA 的稠密逐根优化,发丝训练提速 10 倍,同时保持保真度并可泛化到合成与真实场景。

  10. AGI Hunt41

    伯克利 OmniTaskonomy:19 类图像生成任务如何反哺 25 项视觉理解

    伯克利团队提出 OmniTaskonomy 统一分类体系,覆盖 19 个 I2I 生成任务与 25 个 I2T 理解能力,并绘制跨任务迁移图谱。在正确训练配方下,I2I 训练可提升下游 I2T 性能且生成数据越多收益越大;迁移呈选择性、任务相关,如深度预测提升度量 3D 推理、物体指向提升计数、拼图重建提升 2D 排序。梯度对齐分析显示两类任务对齐越强,下游迁移收益越大。

  11. AGI Hunt48

    SGLang 把 Qwen3.8-27B 变决策模型,百毫秒内通关《宝可梦火红》

    SGLang 团队把 Qwen3.8-27B 改造成多模态决策模型,从实时游戏画面出发,以低于 100 毫秒的决策延迟打通《宝可梦火红》的四天王与冠军。工程层面,SGLang 新增原生 /v1/decisions 接口,可将 LLM 和 VLM 当作分类与打分模型使用;另加 /v1/systemone,让 Jev 类开源模型可配合 TypeSafe SDK 使用。

  12. AWS Machine Learning Blog40

    Condé Nast 如何用 Amazon Bedrock 构建多模态视频发现

    Condé Nast 用 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,将每项内容发现任务耗时从 250 分钟降至不到 2 分钟。方案由 AWS GenAIIC 合作开发,采用 TwelveLabs Marengo 嵌入模型,对超过 140,000 个视频的转录、视觉和音频做意图语义搜索,支持图像查询与精确时间戳。

9月29日周二
  1. AGI Hunt44

    清华等推出 Uni-VLaT:触觉让机器人拍背即走,成功率从 0% 到 85%

    清华、北航、港大等机构合作的 Uni-VLaT 在预训练 VLA 策略中加入触觉,用于人形机器人移动操作。Back-Tap Walking 任务中拍机器人背部即走、停止拍即停,全程无视觉信号,无触觉时成功率 0%,加触觉后达 85%;在原始触觉输入上加预测目标后,五项任务平均成功率从 68% 提升到 75%,方法可跨 GR00T 和 π0.5 两个 backbone 泛化。

  2. TechCrunch · AI55

    Marissa Mayer 推出个人 AI 助手 Dazzle,押注相册比邮箱更懂你

    前雅虎 CEO Marissa Mayer 公开个人 AI 助手 Dazzle,它只从手机相册提取上下文,不用邮箱、日历或购物记录。该产品去年 12 月完成 800 万美元种子轮,功能分为两类:用近期照片处理即时任务,例如按活动传单填日历;以及基于相册给出假期和礼物建议。记者实测中它推荐了地中海目的地,却没记住女儿已经会轮滑;Mayer 强调 Dazzle 会丢弃被判定为敏感的个人信息。

  3. Latent Space61

    AMD 以 82 亿美元收购 World Labs,Atlas 解决稀疏重建问题

    AMD 以 82 亿美元收购 World Labs,后者自 2024 年成立以来主攻空间智能,并在收购 SceniX 后向机器人仿真方向布局。World Labs 称其 Atlas 是首个 omni 模型架构,可从 2D 图像输入预测新的相机视角,用生成模型结合多视图几何解决计算机视觉中的稀疏重建难题,面向机器人、设计与工程等场景。

  4. arXiv cs.AI25

    ACV-Gate:视觉 token 通信中全预算反事实推理的选择性摊销

    ACV-Gate 用 set-aware student 借助终端优势与遗憾预测候选排序,只对受成本阈值约束的有限候选做精确反事实评估,在降低视觉 token 通信编码端计算的同时提升重建质量。在 CIFAR-10 的 0.20 bpp 下,其主配置比 LocalMDL 提升 0.636 dB PSNR,每图仅需 2.13 次候选评估,约为 Exact-Full 专家调用量的 27.60%。

  5. arXiv cs.AI36

    BioEVAL:面向生物工程的全球多机构大语言模型与多模态模型基准

    BioEVAL 是由 22 个研究团队共建的 PhD 级生物工程基准,用于评测大语言模型与多模态模型的实验推理能力。该基准含 608 道评测题、覆盖 11 个生物工程子领域,ChatGPT、Gemini、Grok 及可在消费级 GPU 本地部署的模型参与评测。多选题最高准确率 90%,文献综合相似度 0.72,小样本多模态推理题准确率 80%。