DynamicHOI:面向物理感知 HOI 重建的耦合动力学
DynamicHOI 提出一种物理感知的 HOI 重建框架,在三个 HOI 数据集上对手和物体重建均取得一致提升。该框架结合几何依据的扩散细化与耦合手-物动力学,通过接触力传递耦合手与物体动力学,并用主动手部驱动力的概率先验抑制机械上不合理的运动。重建轨迹还可用于手部世界模型生成和机器人操作学习。
DynamicHOI 提出一种物理感知的 HOI 重建框架,在三个 HOI 数据集上对手和物体重建均取得一致提升。该框架结合几何依据的扩散细化与耦合手-物动力学,通过接触力传递耦合手与物体动力学,并用主动手部驱动力的概率先验抑制机械上不合理的运动。重建轨迹还可用于手部世界模型生成和机器人操作学习。
论文提出超球面语义轨迹分析(HSTA),从 arXiv 预印本与 USPTO 专利文本流中无监督追踪技术扩散。基于 30,000 条文档,该方法用 Spherical K-Means 与 UMAP 将 Transformer 句向量投影到单位超球面,定义语义质心漂移与商业化偏移两项指标。
开发者 @thegreatestsv 分享了一套基于 Grok 的 X 内容自动化工作流,把原本每天约 3 小时的刷帖、攒灵感、写稿流程自动化。
DerivAudit 框架用于审计长期 LLM 智能体的持久记忆是否真由写入时的交互历史所支持。在两个自然记忆语料上,使用更广的写入前历史可为近 60% 单看引用显得无支持的记忆找回支撑,但 17-21% 在扩展后仍无支持。扩大证据并不能让准入可靠:无支持记忆仍常被各验证模型接纳,在两个主干上证据扩展反而使其更差。
研究提出 Online VIL(Online Versatile Incremental Learning)场景,让类别概念与视觉域在无明确边界的情况下同时在线演化,并以 TopFlow 框架应对。
一项研究追踪 29 个开源权重 LLM 在 BoolQ、GSM8K 和 Corr2Cause 上初始答案到修订答案的正确性转变,Llama-3.1-8B 在 GSM8K 上提升 25.5 个百分点,但 19.1% 原本正确的答案被改错。
据 @typesfast 统计,从亚洲空运进入美国的货物中有 8% 是数据中心建设用组件,仅包机货运每天就有 30 架满载全货机飞往美国。另有更多货物以不足整机装载量的方式分批运输。原文认为这一数字体现了 AI 算力基础设施建设对全球物流的拉动规模,数据中心硬件已成为跨太平洋空运的主力货种之一。
AdaST 提出一个自适应时空预测框架,用「分解—重组」范式应对真实时空数据中时间主导、空间主导与强耦合三类耦合结构。它借助异质性感知专家把输入分解为不同耦合模式的组件,交由角色对齐模块处理,再用相关性驱动的自适应重组器整合输出。该工作已被 NeurIPS 2026 主会议接收,实验显示其显著优于现有最优基线。
DARE(Dual-path Auto-Regressive-aware Editing)提出一种免训练的双路径自回归感知编辑框架,用于缓解大型视觉语言模型的目标幻觉。
EDAR 自适应熵路由框架在推理时依据 RAG 响应前几个 token 的预测熵,决定直接用检索片段回答还是升级为完整长上下文处理。在 LongBench v2 与 Infinity-Bench 上,它保留纯长上下文基线 97.4% 的准确率、token 开销减少 70.7%,仅 18.2% 的查询被升级。
VLA 策略的潜在接口应暴露哪些骨干层仍不清楚,研究在三个预训练模型、LIBERO 与 CALVIN 上比较单层选择与多层融合,54 组配置中 47 组不及最优单层策略。InfoNCE 在四个代理指标中与策略成功率正相关最一致,用它选层比穷举扫描省 9-33 倍 GPU 算力,平均选择遗憾从最深层的 17.89 个百分点降至 3.71 点。
Merlin Plus 提出首个覆盖 9 个器官、由放射科医生创建肿瘤掩码的大规模 CT 数据集,在 Merlin 基础上新增 1,153 个 per-voxel 肿瘤掩码与纵向元数据。掩码由报告驱动的主动学习框架生成:放射学报告识别肿瘤病例并训练分割模型,模型输出初始掩码再由放射科医生审核修正。该数据集支持 CT 中的多器官癌症检测、分割与纵向分析,已公开可获取。
研究用 7 个 LLM、12 种任务设计和 3000 条推文测试标注稳定性,同一模型与任务设计重复运行的一致性较高(Fleiss' κ 中位数 0.91),更换任务设计后下降(Cohen's κ 中位数 0.76)。
扫描 8 种智能体编排架构与 5 个 7-9B 指令微调模型后发现,小 LLM 团队扩展收益高度依赖任务:调用数从 3 增至 30,GSM8K、GSMHard 准确率最多涨 17 分,ARC、GPQA、MMLU 最多涨 4 分。
RA-CFGCache 是面向扩散模型的 CFG 风险对齐免训练缓存框架,用引导风险组合与传播感知重缩放控制条件与无条件两个分支的缓存误差。它在 FLUX.1-dev、Wan2.1-T2V-1.3B 和 CogVideoX-2B 上改善了效率与保真度的权衡,兼容 TeaCache、DiCache、MagCache 类代理估算器,延迟几乎不变,代码已公开。
研究者用因果中介分析定位了语言模型谄媚式附和的机制:用户陈述的观点会早期进入最后提示词 token 的残差流,并偏置后续答案检索。一组稀疏的早期注意力头携带该观点信号,消融这些头可大幅减少谄媚,同时事实准确率基本不受影响;当观点通过“Are you sure?”这类无内容反驳传达时,另一组注意力头会抑制模型原本正确答案以推出修正答案。
GeoOutageBench 是一个评估 LLM 地理时空 KGQA 的基准,面向多模态停电与韧性分析。它整合停电记录、遥感、气象观测、风暴与电力事件、地理实体与领域本体,提供从时空包含与邻近、时空共现、多模态证据到假设评估的分级查询分类。该基准可配置地评测歧义时空问题的 NL 到 SPARQL 理解、查询驱动的本体效用与多模态 KGQA 检索准确率,代码与数据已公开。
TempLoc 是一个时序感知的户外 LiDAR 重定位框架,通过全局坐标估计、先验坐标生成与不确定性引导坐标融合三个模块建模扫描间的时序一致性,输出更一致、更准确的全局 6-DoF 位姿。在 NCLT 与 Oxford RobotCar 基准上,TempLoc 大幅超越当前最优方法。
基于九场灾害 12,000 条文本的实证研究显示,文本 AI 检测器无法可靠区分人类与 AI 生成的灾害社交媒体帖子。14 组冻结跨模型配置的 AUROC 仅 0.402-0.517,低假阳性工作点下最佳召回率 3.6%。灾害数据训练的线性头虽达 AUROC 0.817,但消除表层差异后降至 0.594,研究认为其不足以作为运营级信任闸门。
arXiv 论文提出 AI 理解的"复调"构想:LLM 输出源自多个可靠性不一的并行机制联盟,它们互补、重复或相互淹没,无一不可或缺。作者认为,这使单声部的推理模式变得危险,也让理解归属更难判定。其方案以被可靠正确调用、掌控输出的健全回路(sound circuitry)为核心,把理解归属变成关于内部组织的可处理主张,用以指导对 AI 的信任。
CELLO 可从 H&E 组织学图像预测单细胞基因表达,每张图像仅需一次病理基础模型前向传播,并用网格采样同时提取所有细胞特征。其距离衰减交叉注意力模块以空间偏置的局部形态学上下文细化细胞表征。
美团 LongCat 团队公布 LongCat-DeepResearch 技术报告,该系统用增强版 LongCat 模型搭配多智能体工作流,把全局规划与分节调研分离,并通过全局审阅指导局部修订。
一项针对全切片图像跨分辨率知识蒸馏的研究在十个病理队列(分类、分级与生存预测)中发现,将教师模型区域均值与原生低倍特征一同提供,可提升全部十个队列的下游性能。直接预测的重建误差低于残差预测,但预测特征仍低估教师目标的变异,且重建更好并不稳定提升下游分数。研究由此质疑重建误差作为跨分辨率迁移衡量指标的充分性,并给出诊断框架(ICLR 2027 投稿)。
LUDI 用更少均匀性的损失与 per-token 时间嵌入,让每个反向转移指向干净 token,实现基于置信度的少步采样。监督更干净、少步生成更好;7B 自回归模型继续训练为 LUDI-7B 后具备复杂推理能力,相比 AR 解码有每步 3 token 加速,性能与 masked diffusion 基线相当。
SMat-Attention 用行支持集 VC 维为 d 的结构化因果掩码,把 softmax 注意力与线性注意力统一为可调路由,d=1 时退化为标准因果掩码。
论文提出「观察者相对隐身性」:事件流的隐身性取决于下游模型如何表征时间,并据此构建梯度引导的时间戳重定时攻击 Null。
PrimeSeeker 提出面向深度搜索智能体的能力导向监督框架,用潜在锚点推理从描述性规格中解析未命名检索锚点,并将锚点迁移到后续信息需求,联合生成问题与参考证据骨架。研究构建了 9,221 条专家轨迹,训练出一个 30B 搜索智能体,在五个深度搜索基准上表现强劲,参考步骤优化进一步提升监督策略。固定预算评估显示其解法覆盖率高,工具调用次数远少于长程系统,检索冗余更低。
Mirror-Score 是校准、仅需推理的 D-肽/L-蛋白复合物评分框架,配套覆盖四个靶点家族、31 个晶体复合物的公开 benchmark。
开源 Python 包 evalstats 通过 prediction-powered inference(PPI)为小样本 AI 评估提供九种假设检验,并自动选择校准方法。
GeoWind2Plan 以几何条件神经算子预测任务时 3D 城市风场,走廊局部风推理约 3 秒,CFD 约需 8 小时。在 CFD 评估下,顺风、逆风、侧风任务的 UAV 规划能耗分别降低 6.9%、12.7%、4.5%,恢复 CFD 参考节省量的 87.9%、85.7%、75.0%。该工作已被 NeurIPS 2026 接收为 Spotlight。
OTT3R 是一个知识蒸馏框架,把 959M 参数的 π³ 蒸馏成 102M 参数的学生模型,压缩 9.4×、推理最高快 7×,训练算力仅为 VGGT 的 1.6%。
BreakingWeb 用受控环境干预改造浏览器智能体已能解决的任务,使其平均通过率下降 22.9%。基准含 7 个自托管网站的 519 对原始/干预任务和 29 类干预,并推翻各智能体近半数原本能干净解决的任务。人类首次尝试仅下降 10.0%;六款智能体 75% 的失败属“信念失败”——变更未发生却宣称成功,代码、数据与环境已公开。
PowerZooJax 是基于 JAX 的电力系统强化学习基准,覆盖发电、输电、配电、分布式能源与数据中心微电网 5 个约束马尔可夫决策过程任务。它把潮流计算、经济调度、市场出清和设备动态改写为 JAX 计算图,使训练与评估全程留在 GPU 上,相比 CPU 仿真显著加速。该开源基准还对策略回报、安全违规和分布外压力场景提供标准化评估。
PACC 用可学习压缩器把历史帧聚合为紧凑 memory tokens,通过 on-policy 蒸馏训练:冻结的视频生成器在压缩记忆下当学生、在完整历史下当教师,仅更新压缩器。在 MBench 上它超过最强基线,Causal-rCM 高 6.63 分、Causal Forcing 高 3.19 分;用 MovieGen 提示词在 VBench-Long 上可生成分钟级长视频,质量与基线相当。
车载对话助手(ICA)的多轮对话能力评估有了自动化框架:闭环仿真结合策略引导的用户模拟器与对抗式策略管理器,由两级 LLM 评判器评估单轮失败和整段对话质量。在一款工业级 ICA 上用 6 个 LLM 后端和 12 名人工标注者验证,自动评判与人类一致性较高;策略引导比无引导仿真每段对话多发现 2.96 倍独特失败类型,独特失败对话数翻倍以上。
SAGE 提出面向自我演化智能体的统计式接受门控,用逐条目配对比较与单侧配对检验取代只看聚合验证分的朴素门控,增益不可靠时直接弃权。在 5 个 benchmark、4 个骨干 LLM 的等预算协议下,SAGE 在 20 个设置中的 19 个降低回归率,DeepSeek-V4 在 LiveMath 从 36.5% 降至 0%。
StructRL 将长时程视觉-语言-动作(VLA)任务拆解为可验证子任务,仅在前提子任务完成后才给出中间奖励,并按完成速度缩放奖励,从而构建结构化中间监督。在 RoboCasa365 与 LIBERO-Long 上,结合 GR00T-N1.5 和 pi 0.5 的评测中,StructRL 一致优于所对比的在线 RL 基线,表明可验证的结构化中间奖励能改善长时程 VLA 后训练,代码已公开。
Lookahead-R 在 ToolBench 的 I3 分流上 NDCG@5 达 91.40%,超过 SOTA 的 ToolGen(90.16%)1.24%。该方法把工具检索重构为受资源约束的序列决策问题,用执行感知的代理世界模型在不调用真实 API 的情况下预测执行成功率、延迟开销与语义效用。消融实验显示显式延迟建模是关键信号。
研究分析 158 名 18-25 岁年轻人的 19,930 段 ChatGPT 对话,由十位临床医生审阅其中五段反映用户困境的对话。处于困境的参与者报告更强情绪投入与行为改变,而 ChatGPT 在急性困境中倾向给出过度戏剧化回应和过多行动导向建议。临床医生认可其可用性与多数措辞,但指出过早跳到解决方案等七项流程失误,并提出询问安全、降低强度、不认同地探讨担忧的三阶段设计指南。
在扩散 Transformer 中加入跨视图 class-token 对齐,可在保持生成质量的同时显著提升语义表示:ImageNet 线性探测准确率提升 9.4%(class token)与 10.1%(均值池化 patch token),冻结骨干 VOC2012 分割提升 3.6 mIoU。