Highlight-Then-Summarize(H2S):压缩证据提升长上下文理解
北京大学、百度与清华团队提出 H2S(Highlight-Then-Summarize):先定位问题相关的原文证据,压缩为紧凑摘要再作答。在七任务 H2S-Bench 上,H2S-14B 于 128K 输入、4K 输出预算下平均得分 32.60,超 Qwen3.8-27B 10.17 分。该模型为评测开源模型中最强,4K 输出下保留 16K 预算性能的 97.1%。
北京大学、百度与清华团队提出 H2S(Highlight-Then-Summarize):先定位问题相关的原文证据,压缩为紧凑摘要再作答。在七任务 H2S-Bench 上,H2S-14B 于 128K 输入、4K 输出预算下平均得分 32.60,超 Qwen3.8-27B 10.17 分。该模型为评测开源模型中最强,4K 输出下保留 16K 预算性能的 97.1%。
论文识别出 stale-document poisoning(过期文档投毒)现象,即模型在不检索时能答对,检索到过期证据后答案反而被覆盖。作者构建覆盖医学、法律、软件和平台政策的 317 个已验证知识反转基准,在 12 个模型上测试:过期检索让 Llama 30%、Qwen 37% 的回答翻转,加上显式遵循文档的指令后分别升至 66% 和 75%。
在 23 段专家标注的协作学习对话上,两个中型 LLM 无需任务特定训练即可开展意义建构的多维分析,启用推理的提示词能纠正无推理时高估成功案例的偏差。知识状态诊断进一步提供依据,提升了失败意义建构的检出率以及与专家标注的一致度。没有任何单一配置在所有意义建构维度上表现最佳,凸显该任务的多维属性。
该研究分析了 DeepSeek、Qwen、豆包三个中文大模型在 12,165 个来自真实中文搜索查询的是非事实问题上的迎合行为,覆盖 364,941 条回答。研究在有无推理两种模式下对比基线、用户信念注入和反迎合提示三种设置,并区分与错误信念一致的错误和由正确转为不确定的答案。结果显示推理并非一贯的防线,反迎合指令能在减少错误认同的同时增加不确定性。
研究提出用 LLM-as-a-judge 统一衡量输入扰动与 CoT 扰动的强度,并在受控强度条件下评估多个 LLM 生成解释的自一致性。实验显示,该基于 LLM 的扰动强度度量优于嵌入向量和概率方法,且输入扰动对 LLM 的影响普遍强于 CoT 扰动。研究据此认为,只有在同一扰动类型内比较,对模型自一致性的判断才算公平。
针对 SnapKV、PyramidKV 等只按平均注意力排序 token 的 KV cache 驱逐方法,该研究提出加入注意力离散度与冗余惩罚的统一打分,其相似度惩罚无需额外前向。
研究提出由 DCE 与 SRCL 构成的递归在线策略蒸馏框架,让特权教师模型与学生共同演化,在四个竞赛级数学基准上超越 OPSD。在 Qwen3-8B 上,DCE+SRCL 达到 65.97% Average@12,比 OPSD 高出 35.62 个百分点。SRCL 额外以模型自身在线响应更短、经核验的改写进行训练,使平均输出长度较仅用 DCE 减少 7.80%。
一位开发国际象棋 AI 对手的开发者收到反馈:测试玩家吐槽 bot 失误得「有意图、要合理」——它把皇后撤离车攻击后,下一步又送回险地。其方案混合 Maia 与 Stockfish 加自定义选步规则,却常像两个不同棋手在轮流行棋。作者认为人类失误源于注意力焦点与执念而非随机走差,难点是建模「可信的盲点」和「思路的延续性」,又不变得可预测,帖子正征集同类经验。
Claude Opus 5.5 以 88.4% 领跑 SimpleBench,推理强度提到 xhigh 时 Terminal-Bench-Science 由 24% 升至 62%,但 max 反降到 59%。它被评为 Anthropic 史上最佳视觉模型,成本比 Fable 5.1 低约 60%。Opus 5.5 与 GPT-6 Astra 还能纯用代码生成视频动画。
斯坦福研究者 Michael Zlin 指出,LLM 在科学发现任务中的「核查」环节无法形式化验证:即使模型生成的候选集覆盖足够,也没有任何机制能保证模型真的验证了一条声明,而不是生成一段听起来很流畅的验证文本。他认为输出流利不等于推理可信,形式化保证的缺失是当前 LLM 做科学验证的硬伤。
ValsAI 让十个 Claude Sonnet 5.5 智能体使用 Lean 定理证明器,在 15 小时内证出球面上七个电子的最低能量排布(Thomson 问题,N=7)。它们产出 17,895 行形式化证明并被 Lean 内核接受,结论为五角双锥构型。
一项大规模研究借鉴社会科学中的聚合效度与区分效度概念,对 56 个 AI 基准和 53 个模型进行系统检验,发现部分基准并未真正度量其宣称测量的能力。研究指出基准影响 AI 的使用、治理与部署决策,结论对当前评测体系的有效性提出质疑。研究同时公开发布了 53 个模型、56 项基准的逐题输出数据集。
研究团队用聚敛与区分效度方法检验 AI 基准,发现偏差基准 BBQ 可能实际测量的是推理能力而非偏差。BBQ 常是商业模型发布中使用的唯一偏差基准,其结论可能被系统性误读。研究还公开发布了 53 个模型、56 项基准的逐题输出数据集。
CoreWeave 完成 Nvidia Vera Rubin NVL72 在 CoreWeave Cloud 上的行业首次 bring-up 与验证,推进面向智能体 AI 的全栈 AI 云布局。
GRPO 让模型对同一问题采样多次作答,用可验证奖励为每个答案打分,再以组内平均奖励为基线比较各次尝试来更新模型,无需单独的 critic。该方法由 DeepSeekMath 工作提出,用以替代传统 PPO 的内存开销,文中用「6 箱每箱 8 件、卖出 6 件、答案 42」的算术题演示打分与优势计算。组内奖励完全一致时优势全为零,模型无法判断该偏好哪次尝试。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,Simon Willison 记录了自己对这些新模型的定价观察与实测表现。
推荐理由:文章给出 Claude Opus 5.5、GPT-6 Sol 与 Luna 的最新定价和实测表现,可以看清这轮模型降价对调用成本的直接影响。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 在 Amazon Bedrock 正式可用,API 定价显著低于 GPT-5.6 前代。GPT-6 Sol 面向开发与运维中反复出现的复杂任务,GPT-6 Luna 面向大批量重复任务,两者都支持显式提示词缓存。OpenAI 的内部事实性评测显示,GPT-6 Sol 的事实性错误约为 GPT-5.6 Sol 的一半。
推荐理由:两款模型按复杂任务与高频任务分层,API 定价低于 GPT-5.6 前代,可据此判断日常负载的选型。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中,Qwen3-VL 吞吐量最高达 GB300 NVL72 的 3.7 倍。GB300 NVL72 凭 288 个 GPU 跨四机架实现 99% 扩展效率;v6.1 提交的软件优化较 v6.0 最高提升 1.6 倍性能。
曼彻斯特大学用 NVIDIA Earth-2 生成式模型训练出覆盖全英的空气污染模型,分辨率 2-3 平方公里,在 Isambard-AI 的单个八卡节点上仅用两天完成训练。
DACA-GRPO 为扩散语言模型强化学习引入去噪感知信用分配,可作为任意 GRPO 训练器的轻量即插即用增强。在三种 GRPO 基线方法上,它在涵盖数学推理、代码生成、约束满足与 JSON schema 遵循等七个 benchmark 上取得一致提升,最高增益分别为 5.6pp、7.4pp、36.3pp 和 5.9pp。
NVIDIA CEO 黄仁勋在 Salesforce Dreamforce 与 Marc Benioff 同台,Salesforce 同期发布首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 后训练构建。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习把奖励对齐的查询 fan-out 编译成监督信号,蒸馏进仅 53.9M 参数的扩散检索器,实现单次非自回归查询扩展。该框架微调 Gemma3-4B 和 Qwen3-4B,以集合级奖励评估整组结果,绕开零样本 LLM 的语义重复与数百个 CoT 推理 token 带来的自回归延迟。
OpenAI 表示正在分享一份由 AI 生成的纳维-斯托克斯千禧年难题解答,包含一份说明文档和一份 Lean 形式化证明。该条目目前只有这一句简要描述,未提供更多细节。
推荐理由:AI 生成的纳维-斯托克斯千禧年难题解答以 Lean 形式化证明一并公开,读者可关注机器产出数学证明的呈现方式。
Google Gemini 3.8 模型强化了推理与自然语言理解能力,可实时处理数据并提供即时反馈,适用于客户支持自动化、金融数据分析与医疗诊断等场景。对哥伦比亚、西班牙及 LATAM 的企业而言,采用时需权衡成本效率、部署速度与文化适配。Norvik Tech 建议先确定具体用例并开展试点项目,衡量效果后再推进集成。
BenchMIRT 是一种在单条 prompt 层面审计 LLM 基准测试的新方法,基于多维 IRT。它用 100 个 LLM、16 个 benchmark、超 34K 道题的结果训练,未被告知各 benchmark 测什么,却独立恢复出安全与通用推理两大维度。分析还发现 BBQ、WMDP 的得分更贴近通用推理而非安全。
作者把一份手写的 Gemma 4 纯 JAX 端口跑在 Cloud TPU v5e、v6e 和 NVIDIA T4G 上,模型代码、编译缓存和静态形状无需改动即可跨这三种加速器复用。
IBM Granite 团队发布 Granite 4.2 推理模型系列,包含 3B、8B、30B 三个 dense、decoder-only 规模,全部以 Apache 2.0 许可开放。
推荐理由:原文公开了从五阶段预训练到多阶段 RL 的完整构建配方,可对照其他推理模型的开源训练路径。
Quantization-Aware Healing(QAH)让 GPT-OSS 120B 压缩到 60B、量化为 MXFP4 后,在 9 项基准中 7 项超过其 bfloat16 全精度版本。
Gemini 3.7 Flash 于 2026-08-13 上线,输入每百万 token $0.75、输出 $3.75,介绍价 2026-12-31 到期后翻倍为 $1.50 / $7.50,且与 Gemini 3.6 Flash 现价完全相同。
推荐理由:作者在同一路由上对比三档思考级别的实测 token 与首 token 延迟,可帮助开发者估算迁移后的成本变化。
Liquid AI 发布 LFM2.5-DSpark 草稿模型检查点,覆盖 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型,通过投机解码在不改变输出质量的前提下最高提升 3.18 倍吞吐。
Google Research 提出知识画像(knowledge profiling)框架和包含 2,150 条 Wikipedia 事实的 WikiProfile 基准,用于区分 LLM 的事实编码失败与召回失败。
Dwarkesh Patel 与 Redwood Research 首席科学家 Ryan Greenblatt 辩论 AI 能否通过自动化 AI 研发实现递归自我改进。
Mistral 公布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务提供带 SLA 的承诺服务等级和自定义速率限制。
企业 AI 的下一道真实约束已从模型智能转向 GPU 利用率:GPU 按日历小时计成本,产出却只按计算小时计。这与航空业靠飞机利用率决定生死的结构一致,自购 GPU 可把随 token 线性增长的 API 成本换成固定资本支出。但按峰值规模采购的集群在需求不持续时,满载 GPU 仍会浪费大量产能。
Dwarkesh Patel 在博客中提出,随着模型越发智能、同一份算力能变现更多收入,未来几年 AI 算力价格可能上涨 10 倍以上。
Thinking Machines 发布开源多模态模型 Inkling,总参数 975B、激活 41B,支持 1M 上下文并原生接收图像、音频和文本输入。同期推出 Inkling-Small(总参数 276B、激活 12B),采用与 Inkling 相同的架构。
推荐理由:约 1T 参数的开源多模态模型,文章给出多个推理引擎的部署配置和基准对比,便于判断它能否落到现有工作流。
Adam Brown 在 Dwarkesh Patel 播客中深入浅出讲解广义相对论,并延伸到黑洞与 AI 能否从零重新发现该理论。他现任 Google DeepMind BlueShift 负责人,节目从等效原理、爱因斯坦的“最快乐的思想”讲到黑洞与坠入黑洞的观察者体验,结尾讨论 AI 在缺乏实验证据下能走多远。
Hugging Face 表示 vLLM 的 transformers 建模后端现已在多个 LLM 架构上达到甚至超过 vLLM 手写原生实现的吞吐。对比覆盖 Qwen3 4B 单卡、32B 张量并行、235B FP8 MoE 数据加专家并行三种部署,模型只需加 --model-impl transformers 即可启用,且仍可用于训练。
推荐理由:文章给出 transformers 后端与 vLLM 原生实现在三种 Qwen3 模型上的吞吐对比,便于了解免移植推理的实现路径。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可、119B 总参数与 6B 激活参数的形式化验证模型,在 miniF2F 验证集和测试集上均达到 100%。
推荐理由:可对照 Leanstral 1.5 在 PutnamBench 的解题数与约 4 美元单题成本,比较形式化证明模型的性价比。
Google Research 提出把 Multi-Token Prediction(MTP)头接到已冻结的 Gemini Nano v3 主干上,无需为每个任务微调独立的草稿模型即可实现端侧文本生成加速。