跳到正文

全部动态

今日 701 条
今天9月30日周三
  1. arXiv cs.CV35

    DynamicHOI:面向物理感知 HOI 重建的耦合动力学

    DynamicHOI 提出一种物理感知的 HOI 重建框架,在三个 HOI 数据集上对手和物体重建均取得一致提升。该框架结合几何依据的扩散细化与耦合手-物动力学,通过接触力传递耦合手与物体动力学,并用主动手部驱动力的概率先验抑制机械上不合理的运动。重建轨迹还可用于手部世界模型生成和机器人操作学习。

  2. arXiv cs.AI39

    记忆即推导:长期 LLM 智能体的分布式证据悖论与 DerivAudit 审计框架

    DerivAudit 框架用于审计长期 LLM 智能体的持久记忆是否真由写入时的交互历史所支持。在两个自然记忆语料上,使用更广的写入前历史可为近 60% 单看引用显得无支持的记忆找回支撑,但 17-21% 在扩展后仍无支持。扩大证据并不能让准入可靠:无支持记忆仍常被各验证模型接纳,在两个主干上证据扩展反而使其更差。

  3. AGI Hunt53

    亚洲输美空运货物 8% 是数据中心配件,每天 30 架全货机

    据 @typesfast 统计,从亚洲空运进入美国的货物中有 8% 是数据中心建设用组件,仅包机货运每天就有 30 架满载全货机飞往美国。另有更多货物以不足整机装载量的方式分批运输。原文认为这一数字体现了 AI 算力基础设施建设对全球物流的拉动规模,数据中心硬件已成为跨太平洋空运的主力货种之一。

  4. arXiv cs.AI30

    AdaST:面向时空预测的自适应耦合

    AdaST 提出一个自适应时空预测框架,用「分解—重组」范式应对真实时空数据中时间主导、空间主导与强耦合三类耦合结构。它借助异质性感知专家把输入分解为不同耦合模式的组件,交由角色对齐模块处理,再用相关性驱动的自适应重组器整合输出。该工作已被 NeurIPS 2026 主会议接收,实验显示其显著优于现有最优基线。

  5. arXiv cs.AI37

    VLA 的层之谜:VLA 潜在接口的信息论分析

    VLA 策略的潜在接口应暴露哪些骨干层仍不清楚,研究在三个预训练模型、LIBERO 与 CALVIN 上比较单层选择与多层融合,54 组配置中 47 组不及最优单层策略。InfoNCE 在四个代理指标中与策略成功率正相关最一致,用它选层比穷举扫描省 9-33 倍 GPU 算力,平均选择遗憾从最深层的 17.89 个百分点降至 3.71 点。

  6. arXiv cs.CV38

    Merlin Plus:大规模、多癌种、图像-掩码-报告 CT 数据集

    Merlin Plus 提出首个覆盖 9 个器官、由放射科医生创建肿瘤掩码的大规模 CT 数据集,在 Merlin 基础上新增 1,153 个 per-voxel 肿瘤掩码与纵向元数据。掩码由报告驱动的主动学习框架生成:放射学报告识别肿瘤病例并训练分割模型,模型输出初始掩码再由放射科医生审核修正。该数据集支持 CT 中的多器官癌症检测、分割与纵向分析,已公开可获取。

  7. arXiv cs.CV40

    RA-CFGCache:从分支级判据到 Classifier-Free Guidance 下的引导风险控制

    RA-CFGCache 是面向扩散模型的 CFG 风险对齐免训练缓存框架,用引导风险组合与传播感知重缩放控制条件与无条件两个分支的缓存误差。它在 FLUX.1-dev、Wan2.1-T2V-1.3B 和 CogVideoX-2B 上改善了效率与保真度的权衡,兼容 TeaCache、DiCache、MagCache 类代理估算器,延迟几乎不变,代码已公开。

  8. arXiv cs.CL46

    追踪语言模型中谄媚式附和机制

    研究者用因果中介分析定位了语言模型谄媚式附和的机制:用户陈述的观点会早期进入最后提示词 token 的残差流,并偏置后续答案检索。一组稀疏的早期注意力头携带该观点信号,消融这些头可大幅减少谄媚,同时事实准确率基本不受影响;当观点通过“Are you sure?”这类无内容反驳传达时,另一组注意力头会抑制模型原本正确答案以推出修正答案。

  9. arXiv cs.AI31

    GeoOutageBench:面向多模态停电与韧性分析的歧义感知、本体支撑地理时空 KGQA 基准

    GeoOutageBench 是一个评估 LLM 地理时空 KGQA 的基准,面向多模态停电与韧性分析。它整合停电记录、遥感、气象观测、风暴与电力事件、地理实体与领域本体,提供从时空包含与邻近、时空共现、多模态证据到假设评估的分级查询分类。该基准可配置地评测歧义时空问题的 NL 到 SPARQL 理解、查询驱动的本体效用与多模态 KGQA 检索准确率,代码与数据已公开。

  10. arXiv cs.CV30

    面向鲁棒户外 LiDAR 定位的时序感知融合

    TempLoc 是一个时序感知的户外 LiDAR 重定位框架,通过全局坐标估计、先验坐标生成与不确定性引导坐标融合三个模块建模扫描间的时序一致性,输出更一致、更准确的全局 6-DoF 位姿。在 NCLT 与 Oxford RobotCar 基准上,TempLoc 大幅超越当前最优方法。

  11. arXiv cs.CL45

    我们还能信任灾害社交媒体感知吗?检测 AI 生成社交媒体帖子的实证研究

    基于九场灾害 12,000 条文本的实证研究显示,文本 AI 检测器无法可靠区分人类与 AI 生成的灾害社交媒体帖子。14 组冻结跨模型配置的 AUROC 仅 0.402-0.517,低假阳性工作点下最佳召回率 3.6%。灾害数据训练的线性头虽达 AUROC 0.817,但消除表层差异后降至 0.594,研究认为其不足以作为运营级信任闸门。

  12. arXiv cs.AI37

    AI 理解的复调式构想:LLM 输出源自并行机制联盟

    arXiv 论文提出 AI 理解的"复调"构想:LLM 输出源自多个可靠性不一的并行机制联盟,它们互补、重复或相互淹没,无一不可或缺。作者认为,这使单声部的推理模式变得危险,也让理解归属更难判定。其方案以被可靠正确调用、掌控输出的健全回路(sound circuitry)为核心,把理解归属变成关于内部组织的可处理主张,用以指导对 AI 的信任。

  13. arXiv cs.CV35

    高倍率知识为何可迁移?全切片图像中的跨分辨率蒸馏研究

    一项针对全切片图像跨分辨率知识蒸馏的研究在十个病理队列(分类、分级与生存预测)中发现,将教师模型区域均值与原生低倍特征一同提供,可提升全部十个队列的下游性能。直接预测的重建误差低于残差预测,但预测特征仍低估教师目标的变异,且重建更好并不稳定提升下游分数。研究由此质疑重建误差作为跨分辨率迁移衡量指标的充分性,并给出诊断框架(ICLR 2027 投稿)。

  14. arXiv cs.CL31

    PrimeSeeker:面向深度搜索智能体的能力导向监督

    PrimeSeeker 提出面向深度搜索智能体的能力导向监督框架,用潜在锚点推理从描述性规格中解析未命名检索锚点,并将锚点迁移到后续信息需求,联合生成问题与参考证据骨架。研究构建了 9,221 条专家轨迹,训练出一个 30B 搜索智能体,在五个深度搜索基准上表现强劲,参考步骤优化进一步提升监督策略。固定预算评估显示其解法覆盖率高,工具调用次数远少于长程系统,检索冗余更低。

  15. arXiv cs.CL45

    BreakingWeb:用受控环境干预构建高难度浏览器使用任务

    BreakingWeb 用受控环境干预改造浏览器智能体已能解决的任务,使其平均通过率下降 22.9%。基准含 7 个自托管网站的 519 对原始/干预任务和 29 类干预,并推翻各智能体近半数原本能干净解决的任务。人类首次尝试仅下降 10.0%;六款智能体 75% 的失败属“信念失败”——变更未发生却宣称成功,代码、数据与环境已公开。

  16. arXiv cs.AI33

    PowerZooJax:面向强化学习的 JAX 电力系统基准

    PowerZooJax 是基于 JAX 的电力系统强化学习基准,覆盖发电、输电、配电、分布式能源与数据中心微电网 5 个约束马尔可夫决策过程任务。它把潮流计算、经济调度、市场出清和设备动态改写为 JAX 计算图,使训练与评估全程留在 GPU 上,相比 CPU 仿真显著加速。该开源基准还对策略回报、安全违规和分布外压力场景提供标准化评估。

  17. arXiv cs.CV36

    PACC:通过 on-policy 蒸馏学习紧凑记忆,用于长视频生成

    PACC 用可学习压缩器把历史帧聚合为紧凑 memory tokens,通过 on-policy 蒸馏训练:冻结的视频生成器在压缩记忆下当学生、在完整历史下当教师,仅更新压缩器。在 MBench 上它超过最强基线,Causal-rCM 高 6.63 分、Causal Forcing 高 3.19 分;用 MovieGen 提示词在 VBench-Long 上可生成分钟级长视频,质量与基线相当。

  18. arXiv cs.CL36

    车载对话助手(ICA)多轮对话的自动化评估框架

    车载对话助手(ICA)的多轮对话能力评估有了自动化框架:闭环仿真结合策略引导的用户模拟器与对抗式策略管理器,由两级 LLM 评判器评估单轮失败和整段对话质量。在一款工业级 ICA 上用 6 个 LLM 后端和 12 名人工标注者验证,自动评判与人类一致性较高;策略引导比无引导仿真每段对话多发现 2.96 倍独特失败类型,独特失败对话数翻倍以上。

  19. arXiv cs.AI45

    SAGE:面向自我演化智能体的统计式接受门控

    SAGE 提出面向自我演化智能体的统计式接受门控,用逐条目配对比较与单侧配对检验取代只看聚合验证分的朴素门控,增益不可靠时直接弃权。在 5 个 benchmark、4 个骨干 LLM 的等预算协议下,SAGE 在 20 个设置中的 19 个降低回归率,DeepSeek-V4 在 LiveMath 从 36.5% 降至 0%。

  20. arXiv cs.CV37

    StructRL:面向长时程视觉-语言-动作任务的在线结构化强化学习

    StructRL 将长时程视觉-语言-动作(VLA)任务拆解为可验证子任务,仅在前提子任务完成后才给出中间奖励,并按完成速度缩放奖励,从而构建结构化中间监督。在 RoboCasa365 与 LIBERO-Long 上,结合 GR00T-N1.5 和 pi 0.5 的评测中,StructRL 一致优于所对比的在线 RL 基线,表明可验证的结构化中间奖励能改善长时程 VLA 后训练,代码已公开。

  21. arXiv cs.AI50

    措辞对,时机错:临床医生视角下年轻人与 ChatGPT 的 19,930 段困境对话分析

    研究分析 158 名 18-25 岁年轻人的 19,930 段 ChatGPT 对话,由十位临床医生审阅其中五段反映用户困境的对话。处于困境的参与者报告更强情绪投入与行为改变,而 ChatGPT 在急性困境中倾向给出过度戏剧化回应和过多行动导向建议。临床医生认可其可用性与多数措辞,但指出过早跳到解决方案等七项流程失误,并提出询问安全、降低强度、不认同地探讨担忧的三阶段设计指南。