语言模型树结构表达式序列化的通信瓶颈:一项往返研究
研究用往返协议测试 16 个语言模型,发现用自然语言序列化树结构表达式存在有损且不对称的瓶颈,最佳生成-抽取组合准确率 92.9%。交换生成端与抽取端会使准确率变化最多 60.4 个百分点,至少 73.6% 的失败源自生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开放权重模型超过未训练的 Gemini-3.1-Pro。
研究用往返协议测试 16 个语言模型,发现用自然语言序列化树结构表达式存在有损且不对称的瓶颈,最佳生成-抽取组合准确率 92.9%。交换生成端与抽取端会使准确率变化最多 60.4 个百分点,至少 73.6% 的失败源自生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开放权重模型超过未训练的 Gemini-3.1-Pro。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 在 Amazon Bedrock 正式可用,API 定价显著低于 GPT-5.6 前代。GPT-6 Sol 面向开发与运维中反复出现的复杂任务,GPT-6 Luna 面向大批量重复任务,两者都支持显式提示词缓存。OpenAI 的内部事实性评测显示,GPT-6 Sol 的事实性错误约为 GPT-5.6 Sol 的一半。
推荐理由:两款模型按复杂任务与高频任务分层,API 定价低于 GPT-5.6 前代,可据此判断日常负载的选型。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中,Qwen3-VL 吞吐量最高达 GB300 NVL72 的 3.7 倍。GB300 NVL72 凭 288 个 GPU 跨四机架实现 99% 扩展效率;v6.1 提交的软件优化较 v6.0 最高提升 1.6 倍性能。
曼彻斯特大学用 NVIDIA Earth-2 生成式模型训练出覆盖全英的空气污染模型,分辨率 2-3 平方公里,在 Isambard-AI 的单个八卡节点上仅用两天完成训练。
DACA-GRPO 为扩散语言模型强化学习引入去噪感知信用分配,可作为任意 GRPO 训练器的轻量即插即用增强。在三种 GRPO 基线方法上,它在涵盖数学推理、代码生成、约束满足与 JSON schema 遵循等七个 benchmark 上取得一致提升,最高增益分别为 5.6pp、7.4pp、36.3pp 和 5.9pp。
NVIDIA CEO 黄仁勋在 Salesforce Dreamforce 与 Marc Benioff 同台,Salesforce 同期发布首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 后训练构建。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习把奖励对齐的查询 fan-out 编译成监督信号,蒸馏进仅 53.9M 参数的扩散检索器,实现单次非自回归查询扩展。该框架微调 Gemma3-4B 和 Qwen3-4B,以集合级奖励评估整组结果,绕开零样本 LLM 的语义重复与数百个 CoT 推理 token 带来的自回归延迟。
OpenAI 表示正在分享一份由 AI 生成的纳维-斯托克斯千禧年难题解答,包含一份说明文档和一份 Lean 形式化证明。该条目目前只有这一句简要描述,未提供更多细节。
推荐理由:AI 生成的纳维-斯托克斯千禧年难题解答以 Lean 形式化证明一并公开,读者可关注机器产出数学证明的呈现方式。
BenchMIRT 是一种在单条 prompt 层面审计 LLM 基准测试的新方法,基于多维 IRT。它用 100 个 LLM、16 个 benchmark、超 34K 道题的结果训练,未被告知各 benchmark 测什么,却独立恢复出安全与通用推理两大维度。分析还发现 BBQ、WMDP 的得分更贴近通用推理而非安全。
IBM Granite 团队发布 Granite 4.2 推理模型系列,包含 3B、8B、30B 三个 dense、decoder-only 规模,全部以 Apache 2.0 许可开放。
推荐理由:原文公开了从五阶段预训练到多阶段 RL 的完整构建配方,可对照其他推理模型的开源训练路径。
Quantization-Aware Healing(QAH)让 GPT-OSS 120B 压缩到 60B、量化为 MXFP4 后,在 9 项基准中 7 项超过其 bfloat16 全精度版本。
Liquid AI 发布 LFM2.5-DSpark 草稿模型检查点,覆盖 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型,通过投机解码在不改变输出质量的前提下最高提升 3.18 倍吞吐。
Google Research 提出知识画像(knowledge profiling)框架和包含 2,150 条 Wikipedia 事实的 WikiProfile 基准,用于区分 LLM 的事实编码失败与召回失败。
Mistral 公布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务提供带 SLA 的承诺服务等级和自定义速率限制。
企业 AI 的下一道真实约束已从模型智能转向 GPU 利用率:GPU 按日历小时计成本,产出却只按计算小时计。这与航空业靠飞机利用率决定生死的结构一致,自购 GPU 可把随 token 线性增长的 API 成本换成固定资本支出。但按峰值规模采购的集群在需求不持续时,满载 GPU 仍会浪费大量产能。
Thinking Machines 发布开源多模态模型 Inkling,总参数 975B、激活 41B,支持 1M 上下文并原生接收图像、音频和文本输入。同期推出 Inkling-Small(总参数 276B、激活 12B),采用与 Inkling 相同的架构。
推荐理由:约 1T 参数的开源多模态模型,文章给出多个推理引擎的部署配置和基准对比,便于判断它能否落到现有工作流。
Hugging Face 表示 vLLM 的 transformers 建模后端现已在多个 LLM 架构上达到甚至超过 vLLM 手写原生实现的吞吐。对比覆盖 Qwen3 4B 单卡、32B 张量并行、235B FP8 MoE 数据加专家并行三种部署,模型只需加 --model-impl transformers 即可启用,且仍可用于训练。
推荐理由:文章给出 transformers 后端与 vLLM 原生实现在三种 Qwen3 模型上的吞吐对比,便于了解免移植推理的实现路径。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可、119B 总参数与 6B 激活参数的形式化验证模型,在 miniF2F 验证集和测试集上均达到 100%。
推荐理由:可对照 Leanstral 1.5 在 PutnamBench 的解题数与约 4 美元单题成本,比较形式化证明模型的性价比。
Google Research 提出把 Multi-Token Prediction(MTP)头接到已冻结的 Gemini Nano v3 主干上,无需为每个任务微调独立的草稿模型即可实现端侧文本生成加速。
Google Research 的论文发现,开启推理链能让 LLM 回忆出关闭推理时几乎无法获取的简单单跳事实答案,并在 Gemini-2.5 Flash、Gemini-2.5 Pro 和 Qwen3-32B 上用 pass@k 在 SimpleQA Verified 与 EntityQuestions 上验证。
Google 在 I/O 2026 发布 Gemini for Science 实验性工具套件,其中 Computational Discovery 基于 ERA 与 AlphaEvolve,可并行生成并评分数千个代码变体,Hypothesis Generation 则由 Co-Scientist 构建。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,联合 Airbus、BMW 和 ASML 优化设计、仿真与生产,并强调对专有数据、IP 和生产环境的完全控制。
MIT 的 Ritu Raman 与 Boston Children's Hospital 的 Ryan Flynn 借 Co-Scientist 合作研究 ALS,把构建活体神经肌肉组织与绘制细胞表面 RNA 图谱两套工具包结合起来。
Google Research 提出的 ReasoningBank 让智能体从成功与失败经验中提炼高层推理模式,实现测试时自我演化。在 Gemini-2.5-Flash 上,WebArena 成功率比无记忆基线高 8.3%,SWE-Bench-Verified 高 4.6%,每任务少用近 3 个执行步骤。配套的 MaTTS 通过并行与串行扩展,把探索轨迹也转化为高质量记忆。
Google Research 用合成神经元形状增强 PATHFINDER 训练数据,将小鼠轴突重建误差降低 4.4%。其 MoGen 模型基于 PointInfinity 点云流匹配,用 1,795 个小鼠皮层轴突训练,训练数据加入 10% 合成形状即可减少合并错误。MoGen 已开源,论文将在 ICLR 2026 发表;按完整小鼠脑规模计算,相当于节省 157 人年人工校对。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这款面向机器人的推理模型增强了空间推理与多视角理解,并新增仪表读数能力。官方称其在指向、计数和任务成功检测上相比 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 有明显提升。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。
推荐理由:原文列出四档尺寸、Arena 排名与 Apache 2.0 许可,便于判断本地部署和微调的硬件与授权取舍。
Google 推出 TurboQuant,一种零精度损失的压缩算法,可同时压缩 KV cache 并加速向量搜索。它先用 PolarQuant 随机旋转向量完成主体压缩,再用 1 bit 的 QJL 消除残差误差,TurboQuant 将在 ICLR 2026 展示。
Google Research 在 The Check Up 公布医疗 AI 多项进展,其中与 Fitbit 合作的 Personal Health Agent(PHA)研究发现,模拟协作医疗团队的 PHA 比单任务健康应用更能支持长期健康。
Mistral AI 发布 Mistral Small 4,称其是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的编码智能体能力统一进单一模型的 Mistral 模型,以 Apache 2.0 许可开源。
推荐理由:Mistral Small 4 把推理、多模态与编码能力合进一个开源模型,读者可据此评估单模型替代多模型组合的部署取舍。
Mistral 发布 Leanstral,首个面向 Lean 4 的开源代码智能体,Apache 2.0 开源并提供免费 API。该模型激活参数 6B,采用稀疏架构,支持任意 MCP,并针对 lean-lsp-mcp 训练,也可在 Mistral vibe 的 agent 模式中使用。
Google Research 与 Beth Israel Deaconess Medical Center 合作,在真实门诊流程中开展 AMIE 对话式诊断 AI 的前瞻性单中心可行性研究,100 名成年患者就诊前通过安全网页链接与 AMIE 进行文本问诊,全程由医生视频监督,未触发任何安全中止。
推荐理由:研究以盲评方式对比 AMIE 与初级保健医生的鉴别诊断和管理计划质量,为对话式医疗 AI 的真实落地提供参照。
Mistral AI 团队复盘了 vLLM 中的一次内存泄漏排查。在他们用 Mistral Medium 3.1 做 P/D 分离部署并启用图编译时,系统内存以每分钟 400 MB 线性增长,数小时后会进入 OOM 状态。
Mistral 发布 Mistral 3 模型家族,包含稀疏 MoE 的 Mistral Large 3(41B 激活、675B 总参数)与三款密集小模型 Ministral 3(3B、8B、14B),全部以 Apache 2.0 开源。
推荐理由:Mistral 3 一并公布参数规模、开源许可与硬件适配方案,读者可据此对照自身部署条件判断选型。
Mistral 为 Le Chat 推出一批新功能,包括 Deep Research(预览)、语音模式、原生多语言推理、Projects 和图像编辑。Deep Research 由工具增强的研究 agent 驱动,可产出带引用的结构化报告;语音模式基于新语音模型 Voxtral,推理能力来自 Magistral 模型。
Mistral AI 发布首个推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:原文列出两档模型的 AIME2024 分数、开源许可与部署渠道,便于比较开源推理模型的落地方式。
XNNPack 为 TensorFlow Lite 的 Fully Connected 和 Convolution 2D 算子加入动态范围量化支持,CPU 推理性能较 fp32 基线提升 4 倍。
TensorFlow Lite 的 XNNPack 后端在 ARM CPU 上启用半精度(FP16)推理,浮点模型端侧推理性能提升 2 倍,现已正式可用。