跳到正文
热点事件持续更新

PyTorch Helion 内核接入 vLLM 提升吞吐

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 3 日,AGI Hunt 报道,PyTorch 将其内核 DSL Helion 接入 vLLM 的线性后端。报道称,单一 Helion GEMM 实现即可覆盖标准 GEMM、Split-K 与 Swap-AB 三类场景,并能按张量形状自动选择最优变体。在 NVIDIA Hopper GPU 上,结合逐形状调优与混合分发,Helion 在评测的各模型上均优于 vLLM 默认的 CUTLASS 与 DeepGEMM 后端,部分负载的端到端吞吐提升超过 10%。目前可确认的进展即为该内核接入与上述评测结果,报道未披露更多模型清单或后续落地安排。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. AGI Hunt
    PyTorch Helion 内核接入 vLLM:部分负载吞吐提升超 10%

    PyTorch 将内核 DSL Helion 接入 vLLM 的线性后端,单一 Helion GEMM 实现可覆盖标准 GEMM、Split-K、Swap-AB,并按张量形状自动选择最优变体。在 NVIDIA Hopper GPU 上,结合逐形状调优与混合分发,Helion 在评测各模型上均优于 vLLM 默认的 CUTLASS 与 DeepGEMM 后端,部分负载端到端吞吐提升超 10%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。