AGI Hunt· PyTorch·· 3 小时前AI 评分38
PyTorch Helion 内核接入 vLLM:部分负载吞吐提升超 10%
PyTorch Helion 内核接入 vLLM:部分负载吞吐提升超 10%
AI 导读
PyTorch 将内核 DSL Helion 接入 vLLM 的线性后端,单一 Helion GEMM 实现可覆盖标准 GEMM、Split-K、Swap-AB,并按张量形状自动选择最优变体。在 NVIDIA Hopper GPU 上,结合逐形状调优与混合分发,Helion 在评测各模型上均优于 vLLM 默认的 CUTLASS 与 DeepGEMM 后端,部分负载端到端吞吐提升超 10%。
来源:AGI Hunt · agihunt.info