跳到正文
原文
AGI Hunt· PyTorch·· 3 小时前AI 评分38

PyTorch Helion 内核接入 vLLM:部分负载吞吐提升超 10%

PyTorch Helion 内核接入 vLLM:部分负载吞吐提升超 10%

AI 导读

PyTorch 将内核 DSL Helion 接入 vLLM 的线性后端,单一 Helion GEMM 实现可覆盖标准 GEMM、Split-K、Swap-AB,并按张量形状自动选择最优变体。在 NVIDIA Hopper GPU 上,结合逐形状调优与混合分发,Helion 在评测各模型上均优于 vLLM 默认的 CUTLASS 与 DeepGEMM 后端,部分负载端到端吞吐提升超 10%。

来源:AGI Hunt · agihunt.info