跳到正文

#推理

今日 0 条
9月29日周二
  1. Apple Machine Learning Research39

    语言模型树结构表达式序列化的通信瓶颈:一项往返研究

    研究用往返协议测试 16 个语言模型,发现用自然语言序列化树结构表达式存在有损且不对称的瓶颈,最佳生成-抽取组合准确率 92.9%。交换生成端与抽取端会使准确率变化最多 60.4 个百分点,至少 73.6% 的失败源自生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开放权重模型超过未训练的 Gemini-3.1-Pro。

9月23日周三
  1. AWS Machine Learning Blog67

    GPT-6 Sol 与 GPT-6 Luna 在 Amazon Bedrock 正式可用

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 在 Amazon Bedrock 正式可用,API 定价显著低于 GPT-5.6 前代。GPT-6 Sol 面向开发与运维中反复出现的复杂任务,GPT-6 Luna 面向大批量重复任务,两者都支持显式提示词缓存。OpenAI 的内部事实性评测显示,GPT-6 Sol 的事实性错误约为 GPT-5.6 Sol 的一半。

    推荐理由:两款模型按复杂任务与高频任务分层,API 定价低于 GPT-5.6 前代,可据此判断日常负载的选型。

9月16日周三
  1. Google Research37

    绕过推理瓶颈:Google Research 用 Retrieve-for-Train 加速复杂 AI 搜索

    Google Research 提出 Retrieve-for-Train 框架,用离线强化学习把奖励对齐的查询 fan-out 编译成监督信号,蒸馏进仅 53.9M 参数的扩散检索器,实现单次非自回归查询扩展。该框架微调 Gemma3-4B 和 Qwen3-4B,以集合级奖励评估整组结果,绕开零样本 LLM 的语义重复与数百个 CoT 推理 token 带来的自回归延迟。

9月8日周二
  1. OpenAI:官网动态87

    OpenAI 分享 AI 生成的纳维-斯托克斯千禧年难题解答与 Lean 形式化证明

    OpenAI 表示正在分享一份由 AI 生成的纳维-斯托克斯千禧年难题解答,包含一份说明文档和一份 Lean 形式化证明。该条目目前只有这一句简要描述,未提供更多细节。

    推荐理由:AI 生成的纳维-斯托克斯千禧年难题解答以 Lean 形式化证明一并公开,读者可关注机器产出数学证明的呈现方式。

9月2日周三
  1. HuggingFace Blog46

    BenchMIRT:LLM 基准测试究竟在测什么?

    BenchMIRT 是一种在单条 prompt 层面审计 LLM 基准测试的新方法,基于多维 IRT。它用 100 个 LLM、16 个 benchmark、超 34K 道题的结果训练,未被告知各 benchmark 测什么,却独立恢复出安全与通用推理两大维度。分析还发现 BBQ、WMDP 的得分更贴近通用推理而非安全。

8月25日周二
8月21日周五
8月12日周三
8月11日周二
7月30日周四
  1. HuggingFace Blog41

    GPU 管理:为什么闲置 GPU 正成为新的“停场飞机”

    企业 AI 的下一道真实约束已从模型智能转向 GPU 利用率:GPU 按日历小时计成本,产出却只按计算小时计。这与航空业靠飞机利用率决定生死的结构一致,自购 GPU 可把随 token 线性增长的 API 成本换成固定资本支出。但按峰值规模采购的集群在需求不持续时,满载 GPU 仍会浪费大量产能。

7月15日周三
  1. HuggingFace Blog79

    Thinking Machines 发布开源多模态模型 Inkling 及 Inkling-Small

    Thinking Machines 发布开源多模态模型 Inkling,总参数 975B、激活 41B,支持 1M 上下文并原生接收图像、音频和文本输入。同期推出 Inkling-Small(总参数 276B、激活 12B),采用与 Inkling 相同的架构。

    推荐理由:约 1T 参数的开源多模态模型,文章给出多个推理引擎的部署配置和基准对比,便于判断它能否落到现有工作流。

7月8日周三
  1. HuggingFace Blog67

    vLLM 的 transformers 建模后端实现原生推理速度

    Hugging Face 表示 vLLM 的 transformers 建模后端现已在多个 LLM 架构上达到甚至超过 vLLM 手写原生实现的吞吐。对比覆盖 Qwen3 4B 单卡、32B 张量并行、235B FP8 MoE 数据加专家并行三种部署,模型只需加 --model-impl transformers 即可启用,且仍可用于训练。

    推荐理由:文章给出 transformers 后端与 vLLM 原生实现在三种 Qwen3 模型上的吞吐对比,便于了解免移植推理的实现路径。

7月2日周四
6月27日周六
6月25日周四
5月29日周五
5月28日周四
5月16日周六
4月22日周三
  1. Google Research49

    ReasoningBank:让智能体从经验中学习

    Google Research 提出的 ReasoningBank 让智能体从成功与失败经验中提炼高层推理模式,实现测试时自我演化。在 Gemini-2.5-Flash 上,WebArena 成功率比无记忆基线高 8.3%,SWE-Bench-Verified 高 4.6%,每任务少用近 3 个执行步骤。配套的 MaTTS 通过并行与串行扩展,把探索轨迹也转化为高质量记忆。

4月16日周四
  1. Google Research46

    Google Research 提出 MoGen:用 AI 合成神经元加速大脑图谱绘制

    Google Research 用合成神经元形状增强 PATHFINDER 训练数据,将小鼠轴突重建误差降低 4.4%。其 MoGen 模型基于 PointInfinity 点云流匹配,用 1,795 个小鼠皮层轴突训练,训练数据加入 10% 合成形状即可减少合并错误。MoGen 已开源,论文将在 ICLR 2026 发表;按完整小鼠脑规模计算,相当于节省 157 人年人工校对。

4月13日周一
4月3日周五
3月25日周三
3月18日周三
3月17日周二
  1. Mistral AI73

    Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码智能体能力

    Mistral AI 发布 Mistral Small 4,称其是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的编码智能体能力统一进单一模型的 Mistral 模型,以 Apache 2.0 许可开源。

    推荐理由:Mistral Small 4 把推理、多模态与编码能力合进一个开源模型,读者可据此评估单模型替代多模型组合的部署取舍。

3月12日周四
  1. Google Research65

    Google Research 与 BIDMC 开展 AMIE 对话式诊断 AI 真实临床可行性研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作,在真实门诊流程中开展 AMIE 对话式诊断 AI 的前瞻性单中心可行性研究,100 名成年患者就诊前通过安全网页链接与 AMIE 进行文本问诊,全程由医生视频监督,未触发任何安全中止。

    推荐理由:研究以盲评方式对比 AMIE 与初级保健医生的鉴别诊断和管理计划质量,为对话式医疗 AI 的真实落地提供参照。

1月22日周四
12月3日周三
7月17日周四
6月10日周二
4月10日周三
11月30日周四