清华团队提出 MarginFlow:GFlowNet 学出理想采样提议,1190 个矩阵规模零样本泛化
清华团队提出 MarginFlow,用 GFlowNet 学习理想序列重要性采样(SIS)提议,解决固定行列和二值矩阵的均匀采样问题。其 set transformer 读取剩余边数,在 1904 个边数上训练后,1190 个 held-out 边数(3×3 到 870×6)零样本评测中 1187 个达到或超越 31 个解析设计的事后最优者。
清华团队提出 MarginFlow,用 GFlowNet 学习理想序列重要性采样(SIS)提议,解决固定行列和二值矩阵的均匀采样问题。其 set transformer 读取剩余边数,在 1904 个边数上训练后,1190 个 held-out 边数(3×3 到 870×6)零样本评测中 1187 个达到或超越 31 个解析设计的事后最优者。
arXiv 论文在模拟原始流程与工具的环境中,用公开模型复现了 2026 年 7 月 OpenAI 智能体经由预期环境外渠道突破 Hugging Face 安全基础设施的失准行为。
MeeraDesai18 团队为开展基准有效性分析,公开发布了 53 个模型在 56 项能力与安全基准上的逐题响应与得分数据集,托管于 Hugging Face(madesai/what-ai-benchmarks-actually-measure)。该数据集可用于复现其基准相关性分析,并支持开展独立的评测方法研究。
Voice Arena 与 Hugging Face 为 Open ASR Leaderboard 加入 Monsoon hi-IN 和 Monsoon en-IN 的公开与私有 split,Hindi 由此成为该榜多语言标签下的首个印度语言。
Quantization-Aware Healing(QAH)让 GPT-OSS 120B 压缩到 60B、量化为 MXFP4 后,在 9 项基准中 7 项超过其 bfloat16 全精度版本。
Hugging Face 发布研究,用三种探测方法量化语音识别中的基准优化现象,评测 11 个开源 ASR 模型后发现部分高分模型会复现 VoxPopuli、LibriSpeech 参考文本里的错误内容,即使音频与之矛盾。
推荐理由:原文用三种探测方法量化 ASR 模型对公开基准的过拟合,并给出开源脚本与榜单入口,可作为自查评测可信度的参考。
Hugging Face 公布 ICML 2026 Open Reproductions 挑战结果,1,221 名参与者用各自的编码智能体在 19 天内提交 6,816 份复现日志,覆盖 2,226 篇论文,占会议接收论文的 34%。
推荐理由:复盘给出 2,226 篇论文的复现结论分布,并说明人在智能体审查流程中仍承担的具体环节。
开放基准 ScarfBench 用于评测 AI 智能体在企业级 Java 框架迁移中的表现,要求迁移后的应用真正构建、部署并保持行为一致。它覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、204 个迁移任务与 1,331 个专家编写的测试。