腾讯优图联合深大推出 ForgeryVCR,以视觉为中心的图像伪造检测
腾讯优图实验室与深圳大学提出的图像伪造检测方法 ForgeryVCR 被 ACM Multimedia 2026 接收为 Oral。该方法不再沿用「文本中心」的多模态取证流程,而是以统一取证工具箱、视觉中心推理和策略性工具学习,让模型直接基于细微低层视觉痕迹判断是否伪造,避免先用自然语言描述异常带来的信息丢失与语义偏差。
腾讯优图实验室与深圳大学提出的图像伪造检测方法 ForgeryVCR 被 ACM Multimedia 2026 接收为 Oral。该方法不再沿用「文本中心」的多模态取证流程,而是以统一取证工具箱、视觉中心推理和策略性工具学习,让模型直接基于细微低层视觉痕迹判断是否伪造,避免先用自然语言描述异常带来的信息丢失与语义偏差。
新加坡国立大学团队发布 Omni-IO Skills,一个即插即用的 Agent Harness,可让现有通用 agent 具备全模态能力。它包含 27 个 Skills,覆盖 7 种产物模态与 4 类能力的 38 个代表任务,通过 Declare Execution Graphs 并发调度无依赖操作并把成功输出注册到 Asset Registry 供跨轮复用。
Omni-Decision 提出用显式「证据台账」替代不断膨胀的对话历史,由 critic 过滤嘈杂多模态观察,让全模态 agent 的规划器全程在紧凑上下文上工作。
AWS 发布 LEGO-Anything:编码智能体迭代编写并执行 Blender 代码,输出可检视、可编辑、可查询的场景程序而非固定 3D 渲染。配套 LEGO-Bench 含 104 个室内外场景的 208 张图片,评分工件有效性、可见表面几何与渲染外观,GPT-6-astra 综合最强(室内 53.4%、室外 39.6%)。
浙江大学提出 PanoVLN,用全景观察替代透视图像做视觉语言导航(VLN)。4B 骨干、仅 RGB 输入下,在 R2R-CE 和 RxR-CE Val-Unseen 成功率分别超此前 SOTA 11.9% 和 8.7%。配套置信度引导执行(CGE)策略、多分支训练路线,并融合 RGB 全景的语义与几何特征而不增加视觉 token;四足机器人真实场景实验显示导航更快、停顿更少。
MemEvo 提出一个 LLM 驱动的自动研究框架,将流式视频记忆设计转化为对可执行记忆程序的搜索,并产出免训练、有界内存机制。它用轻量 DSL 表达表示、准入、保留、整合、预算和检索等原语,在运行时以确定性评估流程验证候选,底层视觉语言模型全程冻结。在 StreamingBench 和 OVO-Bench 上,该方法展现出强流式视频理解性能,并显著提升上下文与推理效率。
KAIST 提出面向开放词汇语义分割(OVSS)的偏好引导适配框架,用不同提示模板间的「提示分歧」取代像素级标注,从跨模板不确定性高的区域挖掘局部偏好查询。方法采用 Region-Localized Preference Optimization(RLPO)配合区域外一致性正则,在 MESS 基准上让多种 OVSS 骨干获得一致提升,无需任何像素级标注,且在偏好噪声下依然有效。代码已开源。
VideoLoop 用循环工作记忆缓解长视频智能体的「语义抖动」,内循环重写有界工作记忆、从无界文件系统取回过往观察,即插即用使四个主流 LVLM 骨干在 VideoMME (long) 上平均提升 4.2 个百分点。
持久性感知信用门控(PACG)通过削弱异常持久的视觉声明所获正向信用,使多模态模型更易撤回图像无支撑的声明。固定 rollout 反事实诊断显示,DAPO 与 VPPO 下证据函数敏感性(EFS)上升、无支撑声明却更持久,GRPO 无此退化。
研究用相同刺激对比人类与 VLM 的跨模态关联,部分较大 VLM 选择与人类一致,但显著性与人类注视的吻合度低于 center-bias 基线。用人类选择微调小型 VLM,可让其对未见词和图像的选择对齐达到人类多数投票参考水平,注意力仍不如该基线贴近人类注视。用人类注视训练注意力只提升注意力-注视相关性,不改善选择对齐。
Braco 视觉 token 压缩 144 倍仍保持 95.2% 精度,端到端最高提速约 36%。这一轻量四步编码器结合变换基截断、基-坐标嵌入、正交重参数化与轻量池化残差 token,在 23–64 倍压缩下形成最优精度-效率前沿。其 prefill FLOPs 较未压缩上限降低 84.2%–86.7%,压缩器延迟/FLOPs 降低 16.6 倍/78.8 倍。
AVIO 基于预训练的 text-to-audiovisual 生成模型,通过 source-conditioned 特征调制联合学习音视频场景中发声物体的添加与移除。
CaptchaArena 发布首个面向交互式 CAPTCHA 求解的大规模细粒度训练数据集,覆盖 20 种验证码类型、5 种交互模式共 5 万道经执行验证的题目。基于该数据集训练的单一 9B 策略模型 CaptchaAgent 采用 SFT+RL、由环境验证器直接提供 RL 奖励,Pass@1 从 SFT 后的 70.5% 提升至 71.7%,并在两个外部基准上同样提升,数据集与模型均已开源。
DSPO(多样性感知主观策略优化)是一个强化学习框架,通过 VAD 空间中的上下文情感分布先验、Distribution-Aligned Emotional Diversity Reward(DEDR)与 Counterfactual Visual Intervention Gating(CVIG),同时提升 MLLM 情感推理的主观情感覆盖与视觉 grounding。
DuLBE 以双模式低秩学习结合桥原型集成分类器,实现免样本的视觉-语言类增量学习并达到 SOTA 性能。它按梯度需求分配两种视觉低秩更新模式并以梯度路由协调:共享模式复用可迁移知识,残差模式为任务特定变化提供低干扰通道。方法还在单位超球面上为视觉原型与文本嵌入构建测地桥并集成可靠的桥原型,以弥补文本决策边界的模态差距,同时保持低秩调优的参数效率。
研究者提出用于共语手势生成的可靠性感知语义-节奏控制框架:以离散运动先验在 motion-code 空间表示手势,用全多模态分支与纯音频分支的分布差异构造条件信息增益,量化语义对动作预测的影响,在内容相关片段加强语义引导、在节奏主导片段减少干预。该框架把背景噪声视为声学可靠性条件,通过噪声条件特征调制与潜在扰动提升鲁棒性,在基准数据集上兼顾语义表达、节奏同步和动作多样性。
RVP(Reparameterized Inter-Class Visual Reprogramming)通过类内聚合多个文本提示词、跨类施加残差修正来重编程视觉语言模型,并建模共享语义成分与类间差异。
ReWorld-Track 面向语言引导多摄像头跟踪提出递归事件世界模型,将关联不确定性带入未来预测,用来推断下一摄像头与到达时间。该模型在 CityFlowV2 取得 65.19 HOTA、MTMMC 取得 45.36 HOTA。在 MTMMC 上其结构化后验更新较同规模通用更新器高 0.50 HOTA,下一摄像头准确率从 86.03% 升至 87.41%。
YORO 提出单次前向、无需反向传播的视觉重编程方法:BDM 从流式类别统计构建协方差感知仿射映射,在冻结响应空间直接生成下游预测器。三组全数据设置中,平均准确率较最强先前无梯度映射提升 18.4–24.4%;16-shot CLIP 上四骨干平均从 71.4% 升至 77.2%。需要进一步输入适配时,YORO-FP 可选微调视觉提示 20 epochs,验证常保留单次预测器。
rosinality 转发的研究观点称,多模态模型预训练计算量超过 1e22 FLOPs 后可直接去掉视觉编码器,不再需要单独的 vision encoder。该观点认为,在足够大的算力规模下,原生多模态训练可以吸收视觉编码器通常承担的角色。
图像聚类基准 VLM4Cluster 发布,覆盖 17 种经典、深度与语言辅助聚类方法及 20 个数据集,并评测鲁棒性、泛化与计算效率三个维度。结果显示语言辅助聚类(LaIC)在语义要求高的基准上推进性能前沿,分布偏移下泛化更强、效果与效率权衡更优,但在大规模和细粒度数据集上增益不稳定,也未系统性降低对抗扰动敏感性。
OCA(ODE 驱动的交叉注意力)通过常微分方程建模图像到点云(I2P)特征交互,缓解 2D-3D 对应学习中的注意力歧义。该模块可无缝接入现有 I2P 配准框架,作者将其集成进五个 SOTA 基线、在四个公开基准上评测。结果显示配准召回率在标准、微调、零样本设置下分别最高提升 5%、9% 和 15%。
提出 FlexBench 基准与 GM-DPO 分级偏好优化方法,用于改善 VLM 肢体动作描述的细粒度准确性。在三个 VLM backbone 上,GM-DPO 的 GPA 分数较 DPO 提升 2.02-3.40 分,Qwen3-8B 上加权幻觉率降低 21.3%。FlexBench 含 3,105 个镜头、18,161 条评测查询,方法同时保持长文本输出并改善镜头结构。
VidScribe 是统一视频文本基准,覆盖 T2V、R2V、I2V、V2V 四种生成范式,含 803 个人工核验样本与 11 项共享指标。对 11 个商业与开源系统的评测显示,内容识别与笔画级字形正确性解耦,I2V 最能稳定保持文本,V2V 原位编辑是主要瓶颈。退化集中在少数文本结构与时序因素,而非恶劣成像条件。
ThinkingGuard 通过逐步风险归因解码多模态大语言模型中的隐式风险,在标准与隐式安全 benchmark 上取得强表现。
CoRe 用协同演化奖励框架缓解视频扩散模型的 latent reward hacking:生成器数百步更新后即脱离奖励模型训练分布,奖励虚高而画面与运动质量下滑。CoRe 持续在生成器当前样本上重拟合奖励模型,并以真实视频偏好锚定。在 Wan2.1-T2V-1.3B 上,其生成质量优于预训练模型和既有对齐方法。
VisKG 是一个强化学习框架,让模型把视觉内容转换为问题特定的知识图谱(KG)表示,过滤感知噪声并保留链式推理所需的实体-关系结构。该框架用 GDPO 稳定 RL 后训练,在科学、数学和通用视觉理解基准上性能与基线相当或更优,所需 token 少于基于 caption 的表示;GDPO 训练比 GRPO 平均提升 2% 准确率。
在皮肤科测试中,MedSigLIP 视觉编码器在零目标任务标签下平均比 MedGemma 高出 10.26 个百分点,显示医学 VLM 未充分利用其视觉编码器。
MERID 是一个面向重度抑郁症(MDD)分析的多模态递归自改进智能体框架,通过 Grounded State Construction、Coupled Pipeline Exploration 和 Evidence-Guided Evolution 三个模块,依据实验反馈自动修正流水线,并在小样本抑郁队列的不确定性下验证增益后再继承。
ACCV 2026 论文提出 SCCM,用 SPA 与 AAC 两个球面先验在粗匹配阶段校正 ERP 的拓扑、度量与面积畸变,在 Matterport3D 上将 PCK@1° 从 0.229 提升到 0.275,且 refiner 架构不变。
FigAct 可将静态科学图表转化为问题条件下的可视化演示,通过生成简短旁白、将每句旁白定位到对应视觉证据并施加视觉动作来引导注意力。其分层搜索策略让 token 用量降低约 40×,并用 grounding 准确率、搜索效率、渲染质量三项奖励训练出 FigAct-8B。团队还基于真实科学论文图表构建了人工核验 benchmark,评测 MLLMs 生成有依据视觉解释的能力。
VLM 在连接组学突触检测与校对基准评测中多数 zero-shot 仅达随机水平,少量示例主要帮助闭源和最大的开源模型。突触检测覆盖 19 个开源与 2 个闭源模型,比较 zero-shot、four-shot 与 LoRA;校对覆盖 3 个开源与 2 个闭源模型及 ConnectomeBench2 的跨物种迁移。
DARE(Dual-path Auto-Regressive-aware Editing)提出一种免训练的双路径自回归感知编辑框架,用于缓解大型视觉语言模型的目标幻觉。
GeoOutageBench 是一个评估 LLM 地理时空 KGQA 的基准,面向多模态停电与韧性分析。它整合停电记录、遥感、气象观测、风暴与电力事件、地理实体与领域本体,提供从时空包含与邻近、时空共现、多模态证据到假设评估的分级查询分类。该基准可配置地评测歧义时空问题的 NL 到 SPARQL 理解、查询驱动的本体效用与多模态 KGQA 检索准确率,代码与数据已公开。
CELLO 可从 H&E 组织学图像预测单细胞基因表达,每张图像仅需一次病理基础模型前向传播,并用网格采样同时提取所有细胞特征。其距离衰减交叉注意力模块以空间偏置的局部形态学上下文细化细胞表征。
研究团队提出由 story agent、image agent 和 critic agent 组成的多智能体框架,在科学、健康和娱乐领域生成超 9,000 条配对的多模态社交媒体假新闻,并用其评测 16 个开源与闭源 MLLM 的自动检测能力。
MATE 是基于强化学习的后训练框架,让统一多模态模型的生成与理解分支轮流充当挑战者与求解者、相互对抗。在 Janus-Pro-1B 上,它使 GenEval 提升 2.4 分、DPG-Bench 提升 1.7 分,九个理解基准平均提升 0.7 分。对抗候选来自模型自身输出,无需单独训练对抗器,落败候选转为下一轮挑战,训练在数据空间形成自博弈。
LeRF 框架让 VLM 学会构建并使用显式参考坐标系做视角转换推理。模型先判断是否需要坐标系,再定位参考实体并预测坐标系原点与以实体为中心的参考坐标系,由轻量渲染器叠加到图像上,无需外部感知模型或显式 3D 重建。训练先监督微调、再用空间 VQA 数据强化学习,在多个视角转换 benchmark 上优于骨干模型,坐标系定位与朝向估计亦有提升。
PreviewDiff 是一种无需训练的测试时搜索方法,把扩散采样从标量搜索变为对中间潜变量的多模态 critic 引导搜索。它在选定的去噪检查点解码部分预览,由多模态 judge 打分并给出自然语言反馈,据此对语义提示词编辑和局部重新加噪的潜变量分支做评分与选择性续跑。
面向韩语发票信息提取的 OCR 模型将深度学习模型与图像预处理技术结合,在收集的发票数据集上达到 87% F1-score,且处理耗时几乎可忽略。该模型用于自动抽取发票中的购买商品、时间和总金额等信息;韩语是约 8000 万人的母语,在越南、菲律宾等地有大量韩国企业,发票信息自动提取需求明确。