EU AI Act 合规检查器实证研究:12 款主流工具仅能作早期方向指引
首个 EU AI Act 合规检查器(AIACC)实证研究评估 12 款主流工具,发现其质量差异显著,目前只能充当早期方向指引工具。这些工具交互模式与易用性不一致,倾向过度简化或遗漏关键义务,无法提供确定、可执行的指导,依赖其可能带来虚假的合规感。研究据此提出更可靠合规支持工具的设计原则。
首个 EU AI Act 合规检查器(AIACC)实证研究评估 12 款主流工具,发现其质量差异显著,目前只能充当早期方向指引工具。这些工具交互模式与易用性不一致,倾向过度简化或遗漏关键义务,无法提供确定、可执行的指导,依赖其可能带来虚假的合规感。研究据此提出更可靠合规支持工具的设计原则。
基于 62 段受控真实自由落体录像、124 个片段的评测显示,视频世界模型在事件结果被隐去时未必能预测接下来会发生什么。Runway 与 Veo 生成释放和后续撞击事件的比率超过 93%,但常明显滞后;Cosmos-Predict-2.5 与 MAGI-1 则多保持事件前状态,几乎产不出可测结果。在可测下落中,时间上合理不等于运动物理一致;15 人人类研究显示人类预测总体上更贴近真实未来。
PACT 用四个无需新标注的训练项微调单 token 类型化决策模型,在 324 项 holdout 的三个种子上以 84.6% 准确率匹配已发布配方(85.2%),并把重标注下的答案翻转率从 13.8% 降到 9.8%。相比仅用交叉熵的对照,它在三个种子中的两个显著更准,种子间波动减半、NLL 降低 26%;代码、数据划分与训练 adapter 已公开。
FigAct 可将静态科学图表转化为问题条件下的可视化演示,通过生成简短旁白、将每句旁白定位到对应视觉证据并施加视觉动作来引导注意力。其分层搜索策略让 token 用量降低约 40×,并用 grounding 准确率、搜索效率、渲染质量三项奖励训练出 FigAct-8B。团队还基于真实科学论文图表构建了人工核验 benchmark,评测 MLLMs 生成有依据视觉解释的能力。
Reimagine Video Dynamics(RVD)框架从视觉上下文中解耦出紧凑、可编辑的动态 token,并通过自监督重建学习该 token。其语言引导的动态 token 编辑器可将源动态转换为目标动态,训练使用可扩展的反事实视频对管线和两阶段策略。实验显示 RVD 支持视频动态编辑、免训练 retiming 和外观受控重渲染。
一套生成式 AI 流水线用 LLM 从 SEC 10-K 文件中抽取财务数据,针对影响超 70% 公司、占半数总市值的结构化数据缺失问题。研究评测 Llama-3 8B、Qwen-2.5 14B 与 Llama-3.3 70B,在现金及现金等价物、短期债务、信贷额度与研发四类不同结构复杂度的变量上比较抽取质量。
REST(REpresentation-Supervised Thoughts)将因果关系、最小性、可分离性、稳定性四项有效思考表征属性转为可微损失,与交叉熵(CE)联合训练潜空间递归 LLM。在数学、科学、医学与代码生成共 7 个基准上,同等训练数据、算力与潜空间预算下,其准确率比纯 CE 训练最高提升 7.5 个百分点,最终答案收敛率提升 30%,且解码这些思考表征能更好地还原智能体预期输出。
VLM 在连接组学突触检测与校对基准评测中多数 zero-shot 仅达随机水平,少量示例主要帮助闭源和最大的开源模型。突触检测覆盖 19 个开源与 2 个闭源模型,比较 zero-shot、four-shot 与 LoRA;校对覆盖 3 个开源与 2 个闭源模型及 ConnectomeBench2 的跨物种迁移。
研究在四个语言模型与三个数据集上按答案一致性区分高一致(Ghost)与低一致(Flickering)幻觉,测得 0.35 至 0.46 AUC 的可检测性差距。
免训练的通用概率决策模型 Jev 在 WISDM、UCI341、PAMAP2 上最强表示 macro-F1 仅 0.038、0.118、0.089,远低于监督 HAR 模型的 0.686–0.907。
DynamicHOI 提出一种物理感知的 HOI 重建框架,在三个 HOI 数据集上对手和物体重建均取得一致提升。该框架结合几何依据的扩散细化与耦合手-物动力学,通过接触力传递耦合手与物体动力学,并用主动手部驱动力的概率先验抑制机械上不合理的运动。重建轨迹还可用于手部世界模型生成和机器人操作学习。
论文提出超球面语义轨迹分析(HSTA),从 arXiv 预印本与 USPTO 专利文本流中无监督追踪技术扩散。基于 30,000 条文档,该方法用 Spherical K-Means 与 UMAP 将 Transformer 句向量投影到单位超球面,定义语义质心漂移与商业化偏移两项指标。
DerivAudit 框架用于审计长期 LLM 智能体的持久记忆是否真由写入时的交互历史所支持。在两个自然记忆语料上,使用更广的写入前历史可为近 60% 单看引用显得无支持的记忆找回支撑,但 17-21% 在扩展后仍无支持。扩大证据并不能让准入可靠:无支持记忆仍常被各验证模型接纳,在两个主干上证据扩展反而使其更差。
研究提出 Online VIL(Online Versatile Incremental Learning)场景,让类别概念与视觉域在无明确边界的情况下同时在线演化,并以 TopFlow 框架应对。
一项研究追踪 29 个开源权重 LLM 在 BoolQ、GSM8K 和 Corr2Cause 上初始答案到修订答案的正确性转变,Llama-3.1-8B 在 GSM8K 上提升 25.5 个百分点,但 19.1% 原本正确的答案被改错。
AdaST 提出一个自适应时空预测框架,用「分解—重组」范式应对真实时空数据中时间主导、空间主导与强耦合三类耦合结构。它借助异质性感知专家把输入分解为不同耦合模式的组件,交由角色对齐模块处理,再用相关性驱动的自适应重组器整合输出。该工作已被 NeurIPS 2026 主会议接收,实验显示其显著优于现有最优基线。
DARE(Dual-path Auto-Regressive-aware Editing)提出一种免训练的双路径自回归感知编辑框架,用于缓解大型视觉语言模型的目标幻觉。
EDAR 自适应熵路由框架在推理时依据 RAG 响应前几个 token 的预测熵,决定直接用检索片段回答还是升级为完整长上下文处理。在 LongBench v2 与 Infinity-Bench 上,它保留纯长上下文基线 97.4% 的准确率、token 开销减少 70.7%,仅 18.2% 的查询被升级。
VLA 策略的潜在接口应暴露哪些骨干层仍不清楚,研究在三个预训练模型、LIBERO 与 CALVIN 上比较单层选择与多层融合,54 组配置中 47 组不及最优单层策略。InfoNCE 在四个代理指标中与策略成功率正相关最一致,用它选层比穷举扫描省 9-33 倍 GPU 算力,平均选择遗憾从最深层的 17.89 个百分点降至 3.71 点。
Merlin Plus 提出首个覆盖 9 个器官、由放射科医生创建肿瘤掩码的大规模 CT 数据集,在 Merlin 基础上新增 1,153 个 per-voxel 肿瘤掩码与纵向元数据。掩码由报告驱动的主动学习框架生成:放射学报告识别肿瘤病例并训练分割模型,模型输出初始掩码再由放射科医生审核修正。该数据集支持 CT 中的多器官癌症检测、分割与纵向分析,已公开可获取。
研究用 7 个 LLM、12 种任务设计和 3000 条推文测试标注稳定性,同一模型与任务设计重复运行的一致性较高(Fleiss' κ 中位数 0.91),更换任务设计后下降(Cohen's κ 中位数 0.76)。
扫描 8 种智能体编排架构与 5 个 7-9B 指令微调模型后发现,小 LLM 团队扩展收益高度依赖任务:调用数从 3 增至 30,GSM8K、GSMHard 准确率最多涨 17 分,ARC、GPQA、MMLU 最多涨 4 分。
RA-CFGCache 是面向扩散模型的 CFG 风险对齐免训练缓存框架,用引导风险组合与传播感知重缩放控制条件与无条件两个分支的缓存误差。它在 FLUX.1-dev、Wan2.1-T2V-1.3B 和 CogVideoX-2B 上改善了效率与保真度的权衡,兼容 TeaCache、DiCache、MagCache 类代理估算器,延迟几乎不变,代码已公开。
研究者用因果中介分析定位了语言模型谄媚式附和的机制:用户陈述的观点会早期进入最后提示词 token 的残差流,并偏置后续答案检索。一组稀疏的早期注意力头携带该观点信号,消融这些头可大幅减少谄媚,同时事实准确率基本不受影响;当观点通过“Are you sure?”这类无内容反驳传达时,另一组注意力头会抑制模型原本正确答案以推出修正答案。
GeoOutageBench 是一个评估 LLM 地理时空 KGQA 的基准,面向多模态停电与韧性分析。它整合停电记录、遥感、气象观测、风暴与电力事件、地理实体与领域本体,提供从时空包含与邻近、时空共现、多模态证据到假设评估的分级查询分类。该基准可配置地评测歧义时空问题的 NL 到 SPARQL 理解、查询驱动的本体效用与多模态 KGQA 检索准确率,代码与数据已公开。
TempLoc 是一个时序感知的户外 LiDAR 重定位框架,通过全局坐标估计、先验坐标生成与不确定性引导坐标融合三个模块建模扫描间的时序一致性,输出更一致、更准确的全局 6-DoF 位姿。在 NCLT 与 Oxford RobotCar 基准上,TempLoc 大幅超越当前最优方法。
基于九场灾害 12,000 条文本的实证研究显示,文本 AI 检测器无法可靠区分人类与 AI 生成的灾害社交媒体帖子。14 组冻结跨模型配置的 AUROC 仅 0.402-0.517,低假阳性工作点下最佳召回率 3.6%。灾害数据训练的线性头虽达 AUROC 0.817,但消除表层差异后降至 0.594,研究认为其不足以作为运营级信任闸门。
arXiv 论文提出 AI 理解的"复调"构想:LLM 输出源自多个可靠性不一的并行机制联盟,它们互补、重复或相互淹没,无一不可或缺。作者认为,这使单声部的推理模式变得危险,也让理解归属更难判定。其方案以被可靠正确调用、掌控输出的健全回路(sound circuitry)为核心,把理解归属变成关于内部组织的可处理主张,用以指导对 AI 的信任。
CELLO 可从 H&E 组织学图像预测单细胞基因表达,每张图像仅需一次病理基础模型前向传播,并用网格采样同时提取所有细胞特征。其距离衰减交叉注意力模块以空间偏置的局部形态学上下文细化细胞表征。
美团 LongCat 团队公布 LongCat-DeepResearch 技术报告,该系统用增强版 LongCat 模型搭配多智能体工作流,把全局规划与分节调研分离,并通过全局审阅指导局部修订。
一项针对全切片图像跨分辨率知识蒸馏的研究在十个病理队列(分类、分级与生存预测)中发现,将教师模型区域均值与原生低倍特征一同提供,可提升全部十个队列的下游性能。直接预测的重建误差低于残差预测,但预测特征仍低估教师目标的变异,且重建更好并不稳定提升下游分数。研究由此质疑重建误差作为跨分辨率迁移衡量指标的充分性,并给出诊断框架(ICLR 2027 投稿)。
LUDI 用更少均匀性的损失与 per-token 时间嵌入,让每个反向转移指向干净 token,实现基于置信度的少步采样。监督更干净、少步生成更好;7B 自回归模型继续训练为 LUDI-7B 后具备复杂推理能力,相比 AR 解码有每步 3 token 加速,性能与 masked diffusion 基线相当。
SMat-Attention 用行支持集 VC 维为 d 的结构化因果掩码,把 softmax 注意力与线性注意力统一为可调路由,d=1 时退化为标准因果掩码。
论文提出「观察者相对隐身性」:事件流的隐身性取决于下游模型如何表征时间,并据此构建梯度引导的时间戳重定时攻击 Null。
PrimeSeeker 提出面向深度搜索智能体的能力导向监督框架,用潜在锚点推理从描述性规格中解析未命名检索锚点,并将锚点迁移到后续信息需求,联合生成问题与参考证据骨架。研究构建了 9,221 条专家轨迹,训练出一个 30B 搜索智能体,在五个深度搜索基准上表现强劲,参考步骤优化进一步提升监督策略。固定预算评估显示其解法覆盖率高,工具调用次数远少于长程系统,检索冗余更低。
Mirror-Score 是校准、仅需推理的 D-肽/L-蛋白复合物评分框架,配套覆盖四个靶点家族、31 个晶体复合物的公开 benchmark。
开源 Python 包 evalstats 通过 prediction-powered inference(PPI)为小样本 AI 评估提供九种假设检验,并自动选择校准方法。
GeoWind2Plan 以几何条件神经算子预测任务时 3D 城市风场,走廊局部风推理约 3 秒,CFD 约需 8 小时。在 CFD 评估下,顺风、逆风、侧风任务的 UAV 规划能耗分别降低 6.9%、12.7%、4.5%,恢复 CFD 参考节省量的 87.9%、85.7%、75.0%。该工作已被 NeurIPS 2026 接收为 Spotlight。
OTT3R 是一个知识蒸馏框架,把 959M 参数的 π³ 蒸馏成 102M 参数的学生模型,压缩 9.4×、推理最高快 7×,训练算力仅为 VGGT 的 1.6%。
BreakingWeb 用受控环境干预改造浏览器智能体已能解决的任务,使其平均通过率下降 22.9%。基准含 7 个自托管网站的 519 对原始/干预任务和 29 类干预,并推翻各智能体近半数原本能干净解决的任务。人类首次尝试仅下降 10.0%;六款智能体 75% 的失败属“信念失败”——变更未发生却宣称成功,代码、数据与环境已公开。