腾讯优图联合深大推出 ForgeryVCR,以视觉为中心的图像伪造检测
腾讯优图实验室与深圳大学提出的图像伪造检测方法 ForgeryVCR 被 ACM Multimedia 2026 接收为 Oral。该方法不再沿用「文本中心」的多模态取证流程,而是以统一取证工具箱、视觉中心推理和策略性工具学习,让模型直接基于细微低层视觉痕迹判断是否伪造,避免先用自然语言描述异常带来的信息丢失与语义偏差。
腾讯优图实验室与深圳大学提出的图像伪造检测方法 ForgeryVCR 被 ACM Multimedia 2026 接收为 Oral。该方法不再沿用「文本中心」的多模态取证流程,而是以统一取证工具箱、视觉中心推理和策略性工具学习,让模型直接基于细微低层视觉痕迹判断是否伪造,避免先用自然语言描述异常带来的信息丢失与语义偏差。
新加坡国立大学团队发布 Omni-IO Skills,一个即插即用的 Agent Harness,可让现有通用 agent 具备全模态能力。它包含 27 个 Skills,覆盖 7 种产物模态与 4 类能力的 38 个代表任务,通过 Declare Execution Graphs 并发调度无依赖操作并把成功输出注册到 Asset Registry 供跨轮复用。
Omni-Decision 提出用显式「证据台账」替代不断膨胀的对话历史,由 critic 过滤嘈杂多模态观察,让全模态 agent 的规划器全程在紧凑上下文上工作。
ComfyUI v0.38.0 发布,新增 Ming Image 0.1 6B 文生图模型、MiniMax-H3 Fun ControlNet Union 2.0 与基于 Wan 2.1 和 VACE 的 ID-V2V 身份保持视频转视频支持。
推荐理由:版本清单列出新增模型节点与量化、HDR 支持,可据此判断现有 ComfyUI 工作流是否要调整。
独立开发者 Acrobatic-Example315 为 H3 工作流发布小工具 IAMCCS Prompter H3,可用自然语言描述意图,由 Ollama 或其他 LLM 转译为结构化的 H3 提示词。
微软研究院推出实验性多模态 AI 研究系统 Project Quine,定位为把计算生物学建模与实际湿实验衔接起来的生物学“世界模型”。该系统由微软研究院与哈佛大学和麻省理工学院博德研究所共同开发,覆盖基因组学、蛋白质、化学、细胞状态和生物成像的联合表征,并结合交互式推理框架。
Niantic Spatial 的 asimahmed 用 astra 工具在伦敦 Leake Street Arches 实拍场景的高保真高斯泼溅中,仅用几个小时制作了一段短片。该演示把真实空间重建为可编辑、可生成的数字资产,创作者可直接在重建场景中拍摄合成影像。这是 Niantic Spatial“让物理世界对机器可计算”方向的一次直观展示。
开发者 icanberk 用 OpenAI Astra 与 Snap Lens Studio 制作了 SPECS 的演示,展示孩子和家长如何通过 AR 眼镜进行沉浸式学习。转发者 TerekJudi 进一步畅想真实教室中多名学生通过 see-through AR 眼镜加入同一多人学习体验,共同在物理空间协作。该演示呈现了 see-through AR 与多模态 AI 结合在教育场景的可能性。
Dolphin AI 以邀请码方式开启 Early Access,推出主打多镜头一致性的 agentic 视频制作工作室,覆盖长视频、广告、短剧、社交 Reels 等场景。写一次场景即可生成最多 10 个镜头,角色面孔、光线、街景等跨镜头保持一致。测试阶段已用该工具制作超 4.5 万条视频,据称广告 CTR/CTI 有提升。
AWS 发布 LEGO-Anything:编码智能体迭代编写并执行 Blender 代码,输出可检视、可编辑、可查询的场景程序而非固定 3D 渲染。配套 LEGO-Bench 含 104 个室内外场景的 208 张图片,评分工件有效性、可见表面几何与渲染外观,GPT-6-astra 综合最强(室内 53.4%、室外 39.6%)。
浙江大学提出 PanoVLN,用全景观察替代透视图像做视觉语言导航(VLN)。4B 骨干、仅 RGB 输入下,在 R2R-CE 和 RxR-CE Val-Unseen 成功率分别超此前 SOTA 11.9% 和 8.7%。配套置信度引导执行(CGE)策略、多分支训练路线,并融合 RGB 全景的语义与几何特征而不增加视觉 token;四足机器人真实场景实验显示导航更快、停顿更少。
MemEvo 提出一个 LLM 驱动的自动研究框架,将流式视频记忆设计转化为对可执行记忆程序的搜索,并产出免训练、有界内存机制。它用轻量 DSL 表达表示、准入、保留、整合、预算和检索等原语,在运行时以确定性评估流程验证候选,底层视觉语言模型全程冻结。在 StreamingBench 和 OVO-Bench 上,该方法展现出强流式视频理解性能,并显著提升上下文与推理效率。
KAIST 提出面向开放词汇语义分割(OVSS)的偏好引导适配框架,用不同提示模板间的「提示分歧」取代像素级标注,从跨模板不确定性高的区域挖掘局部偏好查询。方法采用 Region-Localized Preference Optimization(RLPO)配合区域外一致性正则,在 MESS 基准上让多种 OVSS 骨干获得一致提升,无需任何像素级标注,且在偏好噪声下依然有效。代码已开源。
VideoLoop 用循环工作记忆缓解长视频智能体的「语义抖动」,内循环重写有界工作记忆、从无界文件系统取回过往观察,即插即用使四个主流 LVLM 骨干在 VideoMME (long) 上平均提升 4.2 个百分点。
持久性感知信用门控(PACG)通过削弱异常持久的视觉声明所获正向信用,使多模态模型更易撤回图像无支撑的声明。固定 rollout 反事实诊断显示,DAPO 与 VPPO 下证据函数敏感性(EFS)上升、无支撑声明却更持久,GRPO 无此退化。
研究用相同刺激对比人类与 VLM 的跨模态关联,部分较大 VLM 选择与人类一致,但显著性与人类注视的吻合度低于 center-bias 基线。用人类选择微调小型 VLM,可让其对未见词和图像的选择对齐达到人类多数投票参考水平,注意力仍不如该基线贴近人类注视。用人类注视训练注意力只提升注意力-注视相关性,不改善选择对齐。
Braco 视觉 token 压缩 144 倍仍保持 95.2% 精度,端到端最高提速约 36%。这一轻量四步编码器结合变换基截断、基-坐标嵌入、正交重参数化与轻量池化残差 token,在 23–64 倍压缩下形成最优精度-效率前沿。其 prefill FLOPs 较未压缩上限降低 84.2%–86.7%,压缩器延迟/FLOPs 降低 16.6 倍/78.8 倍。
AVIO 基于预训练的 text-to-audiovisual 生成模型,通过 source-conditioned 特征调制联合学习音视频场景中发声物体的添加与移除。
CaptchaArena 发布首个面向交互式 CAPTCHA 求解的大规模细粒度训练数据集,覆盖 20 种验证码类型、5 种交互模式共 5 万道经执行验证的题目。基于该数据集训练的单一 9B 策略模型 CaptchaAgent 采用 SFT+RL、由环境验证器直接提供 RL 奖励,Pass@1 从 SFT 后的 70.5% 提升至 71.7%,并在两个外部基准上同样提升,数据集与模型均已开源。
DSPO(多样性感知主观策略优化)是一个强化学习框架,通过 VAD 空间中的上下文情感分布先验、Distribution-Aligned Emotional Diversity Reward(DEDR)与 Counterfactual Visual Intervention Gating(CVIG),同时提升 MLLM 情感推理的主观情感覆盖与视觉 grounding。
DuLBE 以双模式低秩学习结合桥原型集成分类器,实现免样本的视觉-语言类增量学习并达到 SOTA 性能。它按梯度需求分配两种视觉低秩更新模式并以梯度路由协调:共享模式复用可迁移知识,残差模式为任务特定变化提供低干扰通道。方法还在单位超球面上为视觉原型与文本嵌入构建测地桥并集成可靠的桥原型,以弥补文本决策边界的模态差距,同时保持低秩调优的参数效率。
研究者提出用于共语手势生成的可靠性感知语义-节奏控制框架:以离散运动先验在 motion-code 空间表示手势,用全多模态分支与纯音频分支的分布差异构造条件信息增益,量化语义对动作预测的影响,在内容相关片段加强语义引导、在节奏主导片段减少干预。该框架把背景噪声视为声学可靠性条件,通过噪声条件特征调制与潜在扰动提升鲁棒性,在基准数据集上兼顾语义表达、节奏同步和动作多样性。
RVP(Reparameterized Inter-Class Visual Reprogramming)通过类内聚合多个文本提示词、跨类施加残差修正来重编程视觉语言模型,并建模共享语义成分与类间差异。
ReWorld-Track 面向语言引导多摄像头跟踪提出递归事件世界模型,将关联不确定性带入未来预测,用来推断下一摄像头与到达时间。该模型在 CityFlowV2 取得 65.19 HOTA、MTMMC 取得 45.36 HOTA。在 MTMMC 上其结构化后验更新较同规模通用更新器高 0.50 HOTA,下一摄像头准确率从 86.03% 升至 87.41%。
YORO 提出单次前向、无需反向传播的视觉重编程方法:BDM 从流式类别统计构建协方差感知仿射映射,在冻结响应空间直接生成下游预测器。三组全数据设置中,平均准确率较最强先前无梯度映射提升 18.4–24.4%;16-shot CLIP 上四骨干平均从 71.4% 升至 77.2%。需要进一步输入适配时,YORO-FP 可选微调视觉提示 20 epochs,验证常保留单次预测器。
rosinality 转发的研究观点称,多模态模型预训练计算量超过 1e22 FLOPs 后可直接去掉视觉编码器,不再需要单独的 vision encoder。该观点认为,在足够大的算力规模下,原生多模态训练可以吸收视觉编码器通常承担的角色。
图像聚类基准 VLM4Cluster 发布,覆盖 17 种经典、深度与语言辅助聚类方法及 20 个数据集,并评测鲁棒性、泛化与计算效率三个维度。结果显示语言辅助聚类(LaIC)在语义要求高的基准上推进性能前沿,分布偏移下泛化更强、效果与效率权衡更优,但在大规模和细粒度数据集上增益不稳定,也未系统性降低对抗扰动敏感性。
OCA(ODE 驱动的交叉注意力)通过常微分方程建模图像到点云(I2P)特征交互,缓解 2D-3D 对应学习中的注意力歧义。该模块可无缝接入现有 I2P 配准框架,作者将其集成进五个 SOTA 基线、在四个公开基准上评测。结果显示配准召回率在标准、微调、零样本设置下分别最高提升 5%、9% 和 15%。
提出 FlexBench 基准与 GM-DPO 分级偏好优化方法,用于改善 VLM 肢体动作描述的细粒度准确性。在三个 VLM backbone 上,GM-DPO 的 GPA 分数较 DPO 提升 2.02-3.40 分,Qwen3-8B 上加权幻觉率降低 21.3%。FlexBench 含 3,105 个镜头、18,161 条评测查询,方法同时保持长文本输出并改善镜头结构。
VidScribe 是统一视频文本基准,覆盖 T2V、R2V、I2V、V2V 四种生成范式,含 803 个人工核验样本与 11 项共享指标。对 11 个商业与开源系统的评测显示,内容识别与笔画级字形正确性解耦,I2V 最能稳定保持文本,V2V 原位编辑是主要瓶颈。退化集中在少数文本结构与时序因素,而非恶劣成像条件。
ThinkingGuard 通过逐步风险归因解码多模态大语言模型中的隐式风险,在标准与隐式安全 benchmark 上取得强表现。
CoRe 用协同演化奖励框架缓解视频扩散模型的 latent reward hacking:生成器数百步更新后即脱离奖励模型训练分布,奖励虚高而画面与运动质量下滑。CoRe 持续在生成器当前样本上重拟合奖励模型,并以真实视频偏好锚定。在 Wan2.1-T2V-1.3B 上,其生成质量优于预训练模型和既有对齐方法。
VisKG 是一个强化学习框架,让模型把视觉内容转换为问题特定的知识图谱(KG)表示,过滤感知噪声并保留链式推理所需的实体-关系结构。该框架用 GDPO 稳定 RL 后训练,在科学、数学和通用视觉理解基准上性能与基线相当或更优,所需 token 少于基于 caption 的表示;GDPO 训练比 GRPO 平均提升 2% 准确率。
在皮肤科测试中,MedSigLIP 视觉编码器在零目标任务标签下平均比 MedGemma 高出 10.26 个百分点,显示医学 VLM 未充分利用其视觉编码器。
MERID 是一个面向重度抑郁症(MDD)分析的多模态递归自改进智能体框架,通过 Grounded State Construction、Coupled Pipeline Exploration 和 Evidence-Guided Evolution 三个模块,依据实验反馈自动修正流水线,并在小样本抑郁队列的不确定性下验证增益后再继承。
ACCV 2026 论文提出 SCCM,用 SPA 与 AAC 两个球面先验在粗匹配阶段校正 ERP 的拓扑、度量与面积畸变,在 Matterport3D 上将 PCK@1° 从 0.229 提升到 0.275,且 refiner 架构不变。
FigAct 可将静态科学图表转化为问题条件下的可视化演示,通过生成简短旁白、将每句旁白定位到对应视觉证据并施加视觉动作来引导注意力。其分层搜索策略让 token 用量降低约 40×,并用 grounding 准确率、搜索效率、渲染质量三项奖励训练出 FigAct-8B。团队还基于真实科学论文图表构建了人工核验 benchmark,评测 MLLMs 生成有依据视觉解释的能力。
VLM 在连接组学突触检测与校对基准评测中多数 zero-shot 仅达随机水平,少量示例主要帮助闭源和最大的开源模型。突触检测覆盖 19 个开源与 2 个闭源模型,比较 zero-shot、four-shot 与 LoRA;校对覆盖 3 个开源与 2 个闭源模型及 ConnectomeBench2 的跨物种迁移。
DARE(Dual-path Auto-Regressive-aware Editing)提出一种免训练的双路径自回归感知编辑框架,用于缓解大型视觉语言模型的目标幻觉。
GeoOutageBench 是一个评估 LLM 地理时空 KGQA 的基准,面向多模态停电与韧性分析。它整合停电记录、遥感、气象观测、风暴与电力事件、地理实体与领域本体,提供从时空包含与邻近、时空共现、多模态证据到假设评估的分级查询分类。该基准可配置地评测歧义时空问题的 NL 到 SPARQL 理解、查询驱动的本体效用与多模态 KGQA 检索准确率,代码与数据已公开。