高倍率知识为何可迁移?全切片图像中的跨分辨率蒸馏研究
一项针对全切片图像跨分辨率知识蒸馏的研究在十个病理队列(分类、分级与生存预测)中发现,将教师模型区域均值与原生低倍特征一同提供,可提升全部十个队列的下游性能。直接预测的重建误差低于残差预测,但预测特征仍低估教师目标的变异,且重建更好并不稳定提升下游分数。研究由此质疑重建误差作为跨分辨率迁移衡量指标的充分性,并给出诊断框架(ICLR 2027 投稿)。
一项针对全切片图像跨分辨率知识蒸馏的研究在十个病理队列(分类、分级与生存预测)中发现,将教师模型区域均值与原生低倍特征一同提供,可提升全部十个队列的下游性能。直接预测的重建误差低于残差预测,但预测特征仍低估教师目标的变异,且重建更好并不稳定提升下游分数。研究由此质疑重建误差作为跨分辨率迁移衡量指标的充分性,并给出诊断框架(ICLR 2027 投稿)。
LUDI 用更少均匀性的损失与 per-token 时间嵌入,让每个反向转移指向干净 token,实现基于置信度的少步采样。监督更干净、少步生成更好;7B 自回归模型继续训练为 LUDI-7B 后具备复杂推理能力,相比 AR 解码有每步 3 token 加速,性能与 masked diffusion 基线相当。
SMat-Attention 用行支持集 VC 维为 d 的结构化因果掩码,把 softmax 注意力与线性注意力统一为可调路由,d=1 时退化为标准因果掩码。
论文提出「观察者相对隐身性」:事件流的隐身性取决于下游模型如何表征时间,并据此构建梯度引导的时间戳重定时攻击 Null。
PrimeSeeker 提出面向深度搜索智能体的能力导向监督框架,用潜在锚点推理从描述性规格中解析未命名检索锚点,并将锚点迁移到后续信息需求,联合生成问题与参考证据骨架。研究构建了 9,221 条专家轨迹,训练出一个 30B 搜索智能体,在五个深度搜索基准上表现强劲,参考步骤优化进一步提升监督策略。固定预算评估显示其解法覆盖率高,工具调用次数远少于长程系统,检索冗余更低。
Mirror-Score 是校准、仅需推理的 D-肽/L-蛋白复合物评分框架,配套覆盖四个靶点家族、31 个晶体复合物的公开 benchmark。
开源 Python 包 evalstats 通过 prediction-powered inference(PPI)为小样本 AI 评估提供九种假设检验,并自动选择校准方法。
GeoWind2Plan 以几何条件神经算子预测任务时 3D 城市风场,走廊局部风推理约 3 秒,CFD 约需 8 小时。在 CFD 评估下,顺风、逆风、侧风任务的 UAV 规划能耗分别降低 6.9%、12.7%、4.5%,恢复 CFD 参考节省量的 87.9%、85.7%、75.0%。该工作已被 NeurIPS 2026 接收为 Spotlight。
OTT3R 是一个知识蒸馏框架,把 959M 参数的 π³ 蒸馏成 102M 参数的学生模型,压缩 9.4×、推理最高快 7×,训练算力仅为 VGGT 的 1.6%。
BreakingWeb 用受控环境干预改造浏览器智能体已能解决的任务,使其平均通过率下降 22.9%。基准含 7 个自托管网站的 519 对原始/干预任务和 29 类干预,并推翻各智能体近半数原本能干净解决的任务。人类首次尝试仅下降 10.0%;六款智能体 75% 的失败属“信念失败”——变更未发生却宣称成功,代码、数据与环境已公开。
PowerZooJax 是基于 JAX 的电力系统强化学习基准,覆盖发电、输电、配电、分布式能源与数据中心微电网 5 个约束马尔可夫决策过程任务。它把潮流计算、经济调度、市场出清和设备动态改写为 JAX 计算图,使训练与评估全程留在 GPU 上,相比 CPU 仿真显著加速。该开源基准还对策略回报、安全违规和分布外压力场景提供标准化评估。
PACC 用可学习压缩器把历史帧聚合为紧凑 memory tokens,通过 on-policy 蒸馏训练:冻结的视频生成器在压缩记忆下当学生、在完整历史下当教师,仅更新压缩器。在 MBench 上它超过最强基线,Causal-rCM 高 6.63 分、Causal Forcing 高 3.19 分;用 MovieGen 提示词在 VBench-Long 上可生成分钟级长视频,质量与基线相当。
车载对话助手(ICA)的多轮对话能力评估有了自动化框架:闭环仿真结合策略引导的用户模拟器与对抗式策略管理器,由两级 LLM 评判器评估单轮失败和整段对话质量。在一款工业级 ICA 上用 6 个 LLM 后端和 12 名人工标注者验证,自动评判与人类一致性较高;策略引导比无引导仿真每段对话多发现 2.96 倍独特失败类型,独特失败对话数翻倍以上。
SAGE 提出面向自我演化智能体的统计式接受门控,用逐条目配对比较与单侧配对检验取代只看聚合验证分的朴素门控,增益不可靠时直接弃权。在 5 个 benchmark、4 个骨干 LLM 的等预算协议下,SAGE 在 20 个设置中的 19 个降低回归率,DeepSeek-V4 在 LiveMath 从 36.5% 降至 0%。
StructRL 将长时程视觉-语言-动作(VLA)任务拆解为可验证子任务,仅在前提子任务完成后才给出中间奖励,并按完成速度缩放奖励,从而构建结构化中间监督。在 RoboCasa365 与 LIBERO-Long 上,结合 GR00T-N1.5 和 pi 0.5 的评测中,StructRL 一致优于所对比的在线 RL 基线,表明可验证的结构化中间奖励能改善长时程 VLA 后训练,代码已公开。
Lookahead-R 在 ToolBench 的 I3 分流上 NDCG@5 达 91.40%,超过 SOTA 的 ToolGen(90.16%)1.24%。该方法把工具检索重构为受资源约束的序列决策问题,用执行感知的代理世界模型在不调用真实 API 的情况下预测执行成功率、延迟开销与语义效用。消融实验显示显式延迟建模是关键信号。
研究分析 158 名 18-25 岁年轻人的 19,930 段 ChatGPT 对话,由十位临床医生审阅其中五段反映用户困境的对话。处于困境的参与者报告更强情绪投入与行为改变,而 ChatGPT 在急性困境中倾向给出过度戏剧化回应和过多行动导向建议。临床医生认可其可用性与多数措辞,但指出过早跳到解决方案等七项流程失误,并提出询问安全、降低强度、不认同地探讨担忧的三阶段设计指南。
在扩散 Transformer 中加入跨视图 class-token 对齐,可在保持生成质量的同时显著提升语义表示:ImageNet 线性探测准确率提升 9.4%(class token)与 10.1%(均值池化 patch token),冻结骨干 VOC2012 分割提升 3.6 mIoU。
TRACE 是面向肿瘤学 LLM 的可部署树关系结构增强框架:肿瘤学概念与关系被组织为可更新的树关系结构,离线学习结构、在线检索紧凑提示词证据,零样本下无需监督标签即可做任务自适应选择。
COFFEE 是即插即用的离散扩散引导框架,通过分离序列依赖与目标,避免枚举补全带来的指数级计算。它每个扩散步由无目标载体吸收去噪器预测的边缘 token 分布构建联合模型,配合记录组合偏好的编译有限状态模型,无需重训即可采样重建。框架同时支持显式硬约束与学到的软目标,在符号、语言与生物基准上取得强控制结果,质量与多样性存在任务相关权衡。
SAGE-Restore(Stroke-Aware Gated rEstoration)提出一种选择性满文手稿修复框架,先评估哪些区域需要修复,再据此生成修复候选并做像素级选择。
研究团队提出由 story agent、image agent 和 critic agent 组成的多智能体框架,在科学、健康和娱乐领域生成超 9,000 条配对的多模态社交媒体假新闻,并用其评测 16 个开源与闭源 MLLM 的自动检测能力。
研究者对自我发现的 RL 规则 Disco103 做了首次因果机制审计,测试学习历史何时是资产、何时是负担。结果显示,循环历史能把可用奖励尺度窗口维持到六个数量级,而 zero-pinning 下仅三个数量级;不匹配历史的惩罚源自持续钳制,让导入状态自然演化可减轻这一负担。
MATE 是基于强化学习的后训练框架,让统一多模态模型的生成与理解分支轮流充当挑战者与求解者、相互对抗。在 Janus-Pro-1B 上,它使 GenEval 提升 2.4 分、DPG-Bench 提升 1.7 分,九个理解基准平均提升 0.7 分。对抗候选来自模型自身输出,无需单独训练对抗器,落败候选转为下一轮挑战,训练在数据空间形成自博弈。
MATE 是一种确定性的检索后处理流程,把具身智能体检索到的成功轨迹转换为面向执行的记忆,无需额外 LLM 推理。在 134 个 ALFWorld 任务上,MATE 配合 Qwen2.5-14B 与 72B 的任务成功率分别为 81.3% 和 93.3%,token 用量约为原始轨迹的十分之一,其中经核验的动作归一化是恢复检索经验效用的主要机制。
研究从同一 GPT-2 Small 检查点出发,对标准与对抗式持续训练后的模型做对照比较,发现表征更易被 SAE 分解、任务归因中启用的 SAE 特征更少的鲁棒模型,并未对应更小的忠实电路。
LeRF 框架让 VLM 学会构建并使用显式参考坐标系做视角转换推理。模型先判断是否需要坐标系,再定位参考实体并预测坐标系原点与以实体为中心的参考坐标系,由轻量渲染器叠加到图像上,无需外部感知模型或显式 3D 重建。训练先监督微调、再用空间 VQA 数据强化学习,在多个视角转换 benchmark 上优于骨干模型,坐标系定位与朝向估计亦有提升。
一项 arXiv 论文在来自 11 个厂商家族的 23 个小模型、5 项任务、5500 多次辩论与控制运行中检验多智能体辩论(MAD)的收益来源,认知多样性假设在人格、采样温度和模型身份三个维度上均被否定。
推荐理由:23 个模型与 5500 多次运行的对照显示,多智能体辩论的收益可被同预算采样复现,为后续辩论机制给出了比较基线。
自监督框架 SABLE(Sparse-view Animal Behavior Latent Embeddings)以几何归纳偏置和多视角 Transformer,从极稀疏视角重建 3D 动物行为并学习显式 3D 潜结构。
研究首次针对 SFIA 框架给出结构化、等级感知的技能抽取可复现基线,将任务形式化为从自由文本预测 (skill, level) 对,并在 SFIA 的 147 项技能、7 个责任等级上对比五种策略:检索式匹配识别技能最多、生成式策略更精确,只有把等级作为显式决策才能可靠预测,基于相似度的选择错误率高出两倍以上。
提出把 CVaR 作用于每步 belief 即时成本的风险规避在线 POMDP 规划方法。保留期望累积回报目标并维持标准 MDP 结构,现有基于期望的 POMDP 规划器只需改成本计算即可风险敏感。继承策略评估与稀疏采样的有限时间保证,估计误差不随风险水平变化,证明粒子 belief MDP 替代与原 POMDP 的有限时间差距界;风险中性时恢复标准期望规划。
PreviewDiff 是一种无需训练的测试时搜索方法,把扩散采样从标量搜索变为对中间潜变量的多模态 critic 引导搜索。它在选定的去噪检查点解码部分预览,由多模态 judge 打分并给出自然语言反馈,据此对语义提示词编辑和局部重新加噪的潜变量分支做评分与选择性续跑。
Alignment Forecasting 可在训练前预测微调数据是否让目标模型出现欺骗、谄媚等失准,并输出概率。配套基准 ALIGNMENTFORECASTBENCH 含 5000+ 题,覆盖 17 个目标模型、32 个数据集和 16 种失准模式,前沿模型直接提示表现不佳。
受控评估在 MATH-500 的 386 个任务上对比 8 个生成式 harness 与 1 个 baseline 及 9 份字节相同副本,每个执行 3 次:完全相同的程序仍带来 2.16 个百分点的重复平均 oracle 余量。
研究发现,对决策任务中的原始提问做扰动式改写,可缓解部分大语言模型的偏见与幻觉,结论与此前研究相反。在多数数据集任务上 Claude 3 表现更有效,GPT3.5 则参差不齐,部分场景相当、部分明显落后,模型间差异显著。该研究发表于 ICONIP 2024,强调需通过严格测试与验证来保证 LLM 决策辅助工具的可靠性。
研究显示,正则边界规则使英语维基百科上的最优 token 数增加 28.3%–36.8%,并可用最短路径与线性规划松弛给出可独立校验的下界。Byte pair encoding 比受限下界高 2.1%、比无限制下界高 10.9%;在 85M 非嵌入参数与匹配训练 token 预算下,无限制字典在 12 种语言的配对研究中 held-out bits per byte 更优。
研究构建了含 11,000+ 张标注图像的数据集,覆盖触碰、重叠、完全分离与包含等拓扑关系,并评测 Naive Bayes、KNN、Random Forest、SVM、ANN 与 VGG16、InceptionResNetV2。VGG16 验证准确率达 89.55%,明显领先传统模型,图像特征经分割、轮廓检测与灰度归一化提取。
面向韩语发票信息提取的 OCR 模型将深度学习模型与图像预处理技术结合,在收集的发票数据集上达到 87% F1-score,且处理耗时几乎可忽略。该模型用于自动抽取发票中的购买商品、时间和总金额等信息;韩语是约 8000 万人的母语,在越南、菲律宾等地有大量韩国企业,发票信息自动提取需求明确。
提出 DASA,用冻结参考模型的激活梯度反馈优化连续合成输入嵌入,无需人类可读文本即可微调 LLM。在 Llama 与 Qwen 家族 6 个 1B–32B 模型、6 个涵盖知识、数学推理、代码生成和常识推理的 benchmark 上,匹配 LoRA 设置下 DASA 性能与原始自然语言数据相当,部分配置更优,多数比较中优于 GRADMM。
Sieve and Sage 框架把 RALM 的检索失败拆成「无答案」和「受干扰」两种状态,用轻量模块 Sieve 先筛除检索文档中的干扰证据,再交给高开销 LLM(Sage)完成有据生成与拒答。