Merlin Plus:大规模、多癌种、图像-掩码-报告 CT 数据集
Merlin Plus 提出首个覆盖 9 个器官、由放射科医生创建肿瘤掩码的大规模 CT 数据集,在 Merlin 基础上新增 1,153 个 per-voxel 肿瘤掩码与纵向元数据。掩码由报告驱动的主动学习框架生成:放射学报告识别肿瘤病例并训练分割模型,模型输出初始掩码再由放射科医生审核修正。该数据集支持 CT 中的多器官癌症检测、分割与纵向分析,已公开可获取。
Merlin Plus 提出首个覆盖 9 个器官、由放射科医生创建肿瘤掩码的大规模 CT 数据集,在 Merlin 基础上新增 1,153 个 per-voxel 肿瘤掩码与纵向元数据。掩码由报告驱动的主动学习框架生成:放射学报告识别肿瘤病例并训练分割模型,模型输出初始掩码再由放射科医生审核修正。该数据集支持 CT 中的多器官癌症检测、分割与纵向分析,已公开可获取。
研究者用因果中介分析定位了语言模型谄媚式附和的机制:用户陈述的观点会早期进入最后提示词 token 的残差流,并偏置后续答案检索。一组稀疏的早期注意力头携带该观点信号,消融这些头可大幅减少谄媚,同时事实准确率基本不受影响;当观点通过“Are you sure?”这类无内容反驳传达时,另一组注意力头会抑制模型原本正确答案以推出修正答案。
CELLO 可从 H&E 组织学图像预测单细胞基因表达,每张图像仅需一次病理基础模型前向传播,并用网格采样同时提取所有细胞特征。其距离衰减交叉注意力模块以空间偏置的局部形态学上下文细化细胞表征。
LUDI 用更少均匀性的损失与 per-token 时间嵌入,让每个反向转移指向干净 token,实现基于置信度的少步采样。监督更干净、少步生成更好;7B 自回归模型继续训练为 LUDI-7B 后具备复杂推理能力,相比 AR 解码有每步 3 token 加速,性能与 masked diffusion 基线相当。
SMat-Attention 用行支持集 VC 维为 d 的结构化因果掩码,把 softmax 注意力与线性注意力统一为可调路由,d=1 时退化为标准因果掩码。
论文提出「观察者相对隐身性」:事件流的隐身性取决于下游模型如何表征时间,并据此构建梯度引导的时间戳重定时攻击 Null。
PrimeSeeker 提出面向深度搜索智能体的能力导向监督框架,用潜在锚点推理从描述性规格中解析未命名检索锚点,并将锚点迁移到后续信息需求,联合生成问题与参考证据骨架。研究构建了 9,221 条专家轨迹,训练出一个 30B 搜索智能体,在五个深度搜索基准上表现强劲,参考步骤优化进一步提升监督策略。固定预算评估显示其解法覆盖率高,工具调用次数远少于长程系统,检索冗余更低。
Mirror-Score 是校准、仅需推理的 D-肽/L-蛋白复合物评分框架,配套覆盖四个靶点家族、31 个晶体复合物的公开 benchmark。
GeoWind2Plan 以几何条件神经算子预测任务时 3D 城市风场,走廊局部风推理约 3 秒,CFD 约需 8 小时。在 CFD 评估下,顺风、逆风、侧风任务的 UAV 规划能耗分别降低 6.9%、12.7%、4.5%,恢复 CFD 参考节省量的 87.9%、85.7%、75.0%。该工作已被 NeurIPS 2026 接收为 Spotlight。
OTT3R 是一个知识蒸馏框架,把 959M 参数的 π³ 蒸馏成 102M 参数的学生模型,压缩 9.4×、推理最高快 7×,训练算力仅为 VGGT 的 1.6%。
在扩散 Transformer 中加入跨视图 class-token 对齐,可在保持生成质量的同时显著提升语义表示:ImageNet 线性探测准确率提升 9.4%(class token)与 10.1%(均值池化 patch token),冻结骨干 VOC2012 分割提升 3.6 mIoU。
SAGE-Restore(Stroke-Aware Gated rEstoration)提出一种选择性满文手稿修复框架,先评估哪些区域需要修复,再据此生成修复候选并做像素级选择。
研究团队提出由 story agent、image agent 和 critic agent 组成的多智能体框架,在科学、健康和娱乐领域生成超 9,000 条配对的多模态社交媒体假新闻,并用其评测 16 个开源与闭源 MLLM 的自动检测能力。
MATE 是一种确定性的检索后处理流程,把具身智能体检索到的成功轨迹转换为面向执行的记忆,无需额外 LLM 推理。在 134 个 ALFWorld 任务上,MATE 配合 Qwen2.5-14B 与 72B 的任务成功率分别为 81.3% 和 93.3%,token 用量约为原始轨迹的十分之一,其中经核验的动作归一化是恢复检索经验效用的主要机制。
一项 arXiv 论文在来自 11 个厂商家族的 23 个小模型、5 项任务、5500 多次辩论与控制运行中检验多智能体辩论(MAD)的收益来源,认知多样性假设在人格、采样温度和模型身份三个维度上均被否定。
推荐理由:23 个模型与 5500 多次运行的对照显示,多智能体辩论的收益可被同预算采样复现,为后续辩论机制给出了比较基线。
自监督框架 SABLE(Sparse-view Animal Behavior Latent Embeddings)以几何归纳偏置和多视角 Transformer,从极稀疏视角重建 3D 动物行为并学习显式 3D 潜结构。
研究首次针对 SFIA 框架给出结构化、等级感知的技能抽取可复现基线,将任务形式化为从自由文本预测 (skill, level) 对,并在 SFIA 的 147 项技能、7 个责任等级上对比五种策略:检索式匹配识别技能最多、生成式策略更精确,只有把等级作为显式决策才能可靠预测,基于相似度的选择错误率高出两倍以上。
Alignment Forecasting 可在训练前预测微调数据是否让目标模型出现欺骗、谄媚等失准,并输出概率。配套基准 ALIGNMENTFORECASTBENCH 含 5000+ 题,覆盖 17 个目标模型、32 个数据集和 16 种失准模式,前沿模型直接提示表现不佳。
受控评估在 MATH-500 的 386 个任务上对比 8 个生成式 harness 与 1 个 baseline 及 9 份字节相同副本,每个执行 3 次:完全相同的程序仍带来 2.16 个百分点的重复平均 oracle 余量。
研究构建了含 11,000+ 张标注图像的数据集,覆盖触碰、重叠、完全分离与包含等拓扑关系,并评测 Naive Bayes、KNN、Random Forest、SVM、ANN 与 VGG16、InceptionResNetV2。VGG16 验证准确率达 89.55%,明显领先传统模型,图像特征经分割、轮廓检测与灰度归一化提取。
面向韩语发票信息提取的 OCR 模型将深度学习模型与图像预处理技术结合,在收集的发票数据集上达到 87% F1-score,且处理耗时几乎可忽略。该模型用于自动抽取发票中的购买商品、时间和总金额等信息;韩语是约 8000 万人的母语,在越南、菲律宾等地有大量韩国企业,发票信息自动提取需求明确。
FD-VAD 提出免 ASR 的流式语义端点检测,直接把因果音频窗口映射为 Continue/Stop 决策。该模型由冻结语音编码器、轻量模态适配器和参数高效适配的语言模型组成,采用 last-chunk 训练目标,并引入置信度门控端点提交。在 TurnBench dev set 上,其零样本 EOT recall 达 0.853(FP<=0.10)。
Persistence Forcing(PerF)在像素空间扩散 Transformer 中引入异构精炼,让持续特征引导活跃特征的精炼。PerF-L 以一半参数量在 ImageNet 256×256 上取得 FID 1.91,接近 JiT-H 的 1.86;PerF-H 在 256×256 与 512×512 上分别为 1.63 和 1.76。
作者称首次将多智能体 VLN 形式化为带依赖与资源约束的协同问题,并发布 MAVLN 基准与 TRISS 协作导航系统。MAVLN 含 11,724 条 episode、145 个场景,覆盖最多四个智能体与三种指令设定,配套约束感知指标。TRISS 由基于 LLM 的子任务调度器、共享拓扑记忆与冲突感知执行机制构成,实验显示其可作为综合基线,调度、规划与执行仍有较大提升空间。
HERO 是 ViT-G/14 病理基础模型,用 DINO 与 iBOT 目标训练、以高分辨率 Gram anchoring 精调,语料为约 575,000 张临床全切片图像的 5 亿个 tile。公开基准上,它对中心、扫描仪与染色变化的稳健性优于所对比的 SOTA 基础模型,分类、分割和基因表达预测表现相当,并在 39 个切片级临床任务上平均排名第一。
约翰霍普金斯大学团队发布 BiomedSQL,首个针对真实生物医学知识库、显式考察科学推理能力的 text-to-SQL 基准,含 68,000 组「问题/SQL/答案」三元组,基于整合基因-疾病关联、组学因果推断与药物审批记录的 BigQuery 知识库。
Marcus Hutter、Shane Legg 等 14 位研究者发布 arXiv 论文《From cacophony to hierarchy》,提出评估 AI 意识能力的原则性框架。
AtomWorld-Mem 提出记忆恢复的原子世界模型,用短期事件记忆与长期结构记忆整合多尺度原子关键帧,从瞬时晶体快照恢复缺失的潜世界状态,并在单事件 KMC 约束下优先筛选合法的空位介导事件。在固定微观事件预算下,它提升了长时程原子演化进度,并保持能量、结构与空位输运观测量的高保真演化。该机制还可零样本迁移到未见过的合金-温度 AtomWorld。
针对 NetHack 的研究提出 CodeHack 代码技能库,让语言智能体调用带自然语言描述的可复用技能,而不是逐步选择原始动作。零样本评估中,技能相比原始动作使游戏进度接近提升至三倍,每回合推理成本降低 86%;在强化学习下,相同训练预算内技能智能体的地牢层数平均增益达 7.2 倍。技能与原始动作组合可保留大部分收益,CodeHack 及训练、评估代码已开源。
Structured Thinking 两轮流程先外化 schema 约束的 CPDAG 摘要再作答,将 Qwen3.5-27B 在 Corr2Cause 全量测试上的 F1(Yes) 从 73.0 提升到 86.4(+13.4 pp)。
SCALPEL 是一种对比式稀疏自编码器,用于表征层的选择性机器遗忘,可缓解重建式提取偏向背景结构、忽略低能量目标成分的能量偏置。在 TOFU 上对 Qwen、Llama、Gemma 的实验中,它优于 NMF 和标准 SAE 干预,与 Gradient Difference、RMU 相当。理论分析显示,对比训练能促进目标选择性特征,其选择分数可控制背景知识扰动的期望。
7 个不同厂商的 LLM 对 S&P 500 财报电话会议记录打分,13 项文本指标(情感、管理层清晰度、不确定性、气候与政治风险等)的跨模型秩相关平均仅 0.52,跨厂商共有的文本差异只解释 34% 的得分变异。
LogicTree-RAG 提出用逻辑树引导检索增强生成,为长篇幅专利起草提供全局组织骨架,无需专家预设起草大纲。它把每个技术元素构建为逻辑树节点,再通过混合遍历映射到专利章节,实现可控且章节均衡的生成。实验显示,该框架在内容质量和语言合规性上优于强 LLM 基线,并能以高 token 效率完成更长的结构化生成。
FRAIL 框架下,7 个主流 LLM 智能体社会普遍出现集体脆弱性:在无智能体被指示破坏系统时,77% 的银行挤兑与 83% 的债务展期基线轮次仍以失败收场。补偿承诺、中心化承诺协议和参与者主导联盟三种交互机制均改善总体结果,但没有一种在所有金融结构中表现最佳。成功稳定共享同一模式——广泛承诺需在防御行为自我强化之前早期形成;代码已公开。
MACBT 将 CBT 的评估、苏格拉底式提问、认知重构、行为实验和治疗监测五阶段编码为五个协作智能体,并配 CD Memory 纵向记忆模块。基于 Qwen3-14B 经监督微调和 DPO 训练,GPT-4 评判下专业性与临床真实性为 2.62 和 2.25,优于 MeChat、SoulChat、PsyChat、CPsyCounX。
JevSoup 是一个免训练的 LoRA 组合框架,将 System-One 专家路由与 System-Two 执行分离,仅凭输入和专家描述以结构化概率选出两个专家。
GUI-Hopper 让移动端 GUI 智能体采用混合交互:用 App 原生 deeplink 直接跳转导航,用点击、滑动等 GUI 动作完成屏幕内操作并在失败时兜底。该方法通过静态分析发现候选 deeplink,在真机验证并描述其落地屏幕,构建可验证的 deeplink 目录。在真机商用应用中,GUI-Hopper 提升了任务成功率。
TISD 提出一种分支-重生成-蒸馏算法:强制教师选择的轨迹分支动作,由学生生成后续后缀,再用特权上下文条件教师蒸馏完整轨迹。在编码模型上,TISD 较 SDPO 将平均 Avg@4 提升 1.2 个百分点;在科学领域,等步数预算下平均 Avg@128 提升 0.8 分,等时间预算下提升 0.3 分。这些结果支持教师引导的分支可作为暴露有用后继上下文的自蒸馏方式。
研究用能量景观统一解释扩散语言模型(dLLM)越狱为何成功:攻击或在初始化时模糊查询的安全倾向,或在去噪中途干预迫使路径跨越能量壁垒。据此导出三个免训练检测信号,包括读取初始安全倾向的 step-0 比率与两个追踪去噪动能的轨迹速度信号。在 LLaDA-8B、LLaDA-1.5、Dream-7B、LLaDA-MoE-7B 上的压力测试中,绕过检测的配置均无法生成有害内容。
保险准备金智能平台将经典 Thiele 方程求解器与 PINN(含 KINN 损失)结合,用于定期寿险准备金建模。在 200 份保单上 PINN/KINN 推理比经典求解器快约 119.53 倍,测试集 R2 为 0.9887、MAE 785.48、RMSE 1212.76。模型以 7 个特征预测标准化准备金比率,单调性与分布外泛化仍是局限。