跳到正文

全部动态

今日 230 条
今天9月30日周三
  1. arXiv cs.AI45

    EU AI Act 合规检查器实证研究:12 款主流工具仅能作早期方向指引

    首个 EU AI Act 合规检查器(AIACC)实证研究评估 12 款主流工具,发现其质量差异显著,目前只能充当早期方向指引工具。这些工具交互模式与易用性不一致,倾向过度简化或遗漏关键义务,无法提供确定、可执行的指导,依赖其可能带来虚假的合规感。研究据此提出更可靠合规支持工具的设计原则。

  2. arXiv cs.CV38

    事件边界处的预见:评估视频世界模型的物理预测能力

    基于 62 段受控真实自由落体录像、124 个片段的评测显示,视频世界模型在事件结果被隐去时未必能预测接下来会发生什么。Runway 与 Veo 生成释放和后续撞击事件的比率超过 93%,但常明显滞后;Cosmos-Predict-2.5 与 MAGI-1 则多保持事件前状态,几乎产不出可测结果。在可测下落中,时间上合理不等于运动物理一致;15 人人类研究显示人类预测总体上更贴近真实未来。

  3. arXiv cs.CL38

    PACT:面向单 token 类型化决策的成对锚定校准微调

    PACT 用四个无需新标注的训练项微调单 token 类型化决策模型,在 324 项 holdout 的三个种子上以 84.6% 准确率匹配已发布配方(85.2%),并把重标注下的答案翻转率从 13.8% 降到 9.8%。相比仅用交叉熵的对照,它在三个种子中的两个显著更准,种子间波动减半、NLL 降低 26%;代码、数据划分与训练 adapter 已公开。

  4. arXiv cs.AI33

    FigAct:把科学图表变成可主动解释的演示画布

    FigAct 可将静态科学图表转化为问题条件下的可视化演示,通过生成简短旁白、将每句旁白定位到对应视觉证据并施加视觉动作来引导注意力。其分层搜索策略让 token 用量降低约 40×,并用 grounding 准确率、搜索效率、渲染质量三项奖励训练出 FigAct-8B。团队还基于真实科学论文图表构建了人工核验 benchmark,评测 MLLMs 生成有依据视觉解释的能力。

  5. arXiv cs.CV34

    Reimagine Video Dynamics(RVD):解耦可编辑动态 token 的视频动态编辑框架

    Reimagine Video Dynamics(RVD)框架从视觉上下文中解耦出紧凑、可编辑的动态 token,并通过自监督重建学习该 token。其语言引导的动态 token 编辑器可将源动态转换为目标动态,训练使用可扩展的反事实视频对管线和两阶段策略。实验显示 RVD 支持视频动态编辑、免训练 retiming 和外观受控重渲染。

  6. arXiv cs.AI41

    面向潜在递归 LLM 系统的原则化思考:REST 表征监督训练目标

    REST(REpresentation-Supervised Thoughts)将因果关系、最小性、可分离性、稳定性四项有效思考表征属性转为可微损失,与交叉熵(CE)联合训练潜空间递归 LLM。在数学、科学、医学与代码生成共 7 个基准上,同等训练数据、算力与潜空间预算下,其准确率比纯 CE 训练最高提升 7.5 个百分点,最终答案收敛率提升 30%,且解码这些思考表征能更好地还原智能体预期输出。

  7. arXiv cs.CV37

    VLM 在连接组学突触检测与校对中的基准评测

    VLM 在连接组学突触检测与校对基准评测中多数 zero-shot 仅达随机水平,少量示例主要帮助闭源和最大的开源模型。突触检测覆盖 19 个开源与 2 个闭源模型,比较 zero-shot、four-shot 与 LoRA;校对覆盖 3 个开源与 2 个闭源模型及 ConnectomeBench2 的跨物种迁移。

  8. arXiv cs.CV35

    DynamicHOI:面向物理感知 HOI 重建的耦合动力学

    DynamicHOI 提出一种物理感知的 HOI 重建框架,在三个 HOI 数据集上对手和物体重建均取得一致提升。该框架结合几何依据的扩散细化与耦合手-物动力学,通过接触力传递耦合手与物体动力学,并用主动手部驱动力的概率先验抑制机械上不合理的运动。重建轨迹还可用于手部世界模型生成和机器人操作学习。

  9. arXiv cs.AI39

    记忆即推导:长期 LLM 智能体的分布式证据悖论与 DerivAudit 审计框架

    DerivAudit 框架用于审计长期 LLM 智能体的持久记忆是否真由写入时的交互历史所支持。在两个自然记忆语料上,使用更广的写入前历史可为近 60% 单看引用显得无支持的记忆找回支撑,但 17-21% 在扩展后仍无支持。扩大证据并不能让准入可靠:无支持记忆仍常被各验证模型接纳,在两个主干上证据扩展反而使其更差。

  10. arXiv cs.AI30

    AdaST:面向时空预测的自适应耦合

    AdaST 提出一个自适应时空预测框架,用「分解—重组」范式应对真实时空数据中时间主导、空间主导与强耦合三类耦合结构。它借助异质性感知专家把输入分解为不同耦合模式的组件,交由角色对齐模块处理,再用相关性驱动的自适应重组器整合输出。该工作已被 NeurIPS 2026 主会议接收,实验显示其显著优于现有最优基线。

  11. arXiv cs.AI37

    VLA 的层之谜:VLA 潜在接口的信息论分析

    VLA 策略的潜在接口应暴露哪些骨干层仍不清楚,研究在三个预训练模型、LIBERO 与 CALVIN 上比较单层选择与多层融合,54 组配置中 47 组不及最优单层策略。InfoNCE 在四个代理指标中与策略成功率正相关最一致,用它选层比穷举扫描省 9-33 倍 GPU 算力,平均选择遗憾从最深层的 17.89 个百分点降至 3.71 点。

  12. arXiv cs.CV38

    Merlin Plus:大规模、多癌种、图像-掩码-报告 CT 数据集

    Merlin Plus 提出首个覆盖 9 个器官、由放射科医生创建肿瘤掩码的大规模 CT 数据集,在 Merlin 基础上新增 1,153 个 per-voxel 肿瘤掩码与纵向元数据。掩码由报告驱动的主动学习框架生成:放射学报告识别肿瘤病例并训练分割模型,模型输出初始掩码再由放射科医生审核修正。该数据集支持 CT 中的多器官癌症检测、分割与纵向分析,已公开可获取。

  13. arXiv cs.CV40

    RA-CFGCache:从分支级判据到 Classifier-Free Guidance 下的引导风险控制

    RA-CFGCache 是面向扩散模型的 CFG 风险对齐免训练缓存框架,用引导风险组合与传播感知重缩放控制条件与无条件两个分支的缓存误差。它在 FLUX.1-dev、Wan2.1-T2V-1.3B 和 CogVideoX-2B 上改善了效率与保真度的权衡,兼容 TeaCache、DiCache、MagCache 类代理估算器,延迟几乎不变,代码已公开。

  14. arXiv cs.CL46

    追踪语言模型中谄媚式附和机制

    研究者用因果中介分析定位了语言模型谄媚式附和的机制:用户陈述的观点会早期进入最后提示词 token 的残差流,并偏置后续答案检索。一组稀疏的早期注意力头携带该观点信号,消融这些头可大幅减少谄媚,同时事实准确率基本不受影响;当观点通过“Are you sure?”这类无内容反驳传达时,另一组注意力头会抑制模型原本正确答案以推出修正答案。

  15. arXiv cs.AI31

    GeoOutageBench:面向多模态停电与韧性分析的歧义感知、本体支撑地理时空 KGQA 基准

    GeoOutageBench 是一个评估 LLM 地理时空 KGQA 的基准,面向多模态停电与韧性分析。它整合停电记录、遥感、气象观测、风暴与电力事件、地理实体与领域本体,提供从时空包含与邻近、时空共现、多模态证据到假设评估的分级查询分类。该基准可配置地评测歧义时空问题的 NL 到 SPARQL 理解、查询驱动的本体效用与多模态 KGQA 检索准确率,代码与数据已公开。

  16. arXiv cs.CV30

    面向鲁棒户外 LiDAR 定位的时序感知融合

    TempLoc 是一个时序感知的户外 LiDAR 重定位框架,通过全局坐标估计、先验坐标生成与不确定性引导坐标融合三个模块建模扫描间的时序一致性,输出更一致、更准确的全局 6-DoF 位姿。在 NCLT 与 Oxford RobotCar 基准上,TempLoc 大幅超越当前最优方法。

  17. arXiv cs.CL45

    我们还能信任灾害社交媒体感知吗?检测 AI 生成社交媒体帖子的实证研究

    基于九场灾害 12,000 条文本的实证研究显示,文本 AI 检测器无法可靠区分人类与 AI 生成的灾害社交媒体帖子。14 组冻结跨模型配置的 AUROC 仅 0.402-0.517,低假阳性工作点下最佳召回率 3.6%。灾害数据训练的线性头虽达 AUROC 0.817,但消除表层差异后降至 0.594,研究认为其不足以作为运营级信任闸门。

  18. arXiv cs.AI37

    AI 理解的复调式构想:LLM 输出源自并行机制联盟

    arXiv 论文提出 AI 理解的"复调"构想:LLM 输出源自多个可靠性不一的并行机制联盟,它们互补、重复或相互淹没,无一不可或缺。作者认为,这使单声部的推理模式变得危险,也让理解归属更难判定。其方案以被可靠正确调用、掌控输出的健全回路(sound circuitry)为核心,把理解归属变成关于内部组织的可处理主张,用以指导对 AI 的信任。

  19. arXiv cs.CV35

    高倍率知识为何可迁移?全切片图像中的跨分辨率蒸馏研究

    一项针对全切片图像跨分辨率知识蒸馏的研究在十个病理队列(分类、分级与生存预测)中发现,将教师模型区域均值与原生低倍特征一同提供,可提升全部十个队列的下游性能。直接预测的重建误差低于残差预测,但预测特征仍低估教师目标的变异,且重建更好并不稳定提升下游分数。研究由此质疑重建误差作为跨分辨率迁移衡量指标的充分性,并给出诊断框架(ICLR 2027 投稿)。

  20. arXiv cs.CL31

    PrimeSeeker:面向深度搜索智能体的能力导向监督

    PrimeSeeker 提出面向深度搜索智能体的能力导向监督框架,用潜在锚点推理从描述性规格中解析未命名检索锚点,并将锚点迁移到后续信息需求,联合生成问题与参考证据骨架。研究构建了 9,221 条专家轨迹,训练出一个 30B 搜索智能体,在五个深度搜索基准上表现强劲,参考步骤优化进一步提升监督策略。固定预算评估显示其解法覆盖率高,工具调用次数远少于长程系统,检索冗余更低。

  21. arXiv cs.CL45

    BreakingWeb:用受控环境干预构建高难度浏览器使用任务

    BreakingWeb 用受控环境干预改造浏览器智能体已能解决的任务,使其平均通过率下降 22.9%。基准含 7 个自托管网站的 519 对原始/干预任务和 29 类干预,并推翻各智能体近半数原本能干净解决的任务。人类首次尝试仅下降 10.0%;六款智能体 75% 的失败属“信念失败”——变更未发生却宣称成功,代码、数据与环境已公开。