跳到正文
原文
AGI Hunt· PyTorch·· 2 小时前AI 评分46

PyTorch 用 TLX 写 JFA 内核,前向快 FA4 约 13%、反向快 50%

PyTorch 用 TLX 写 JFA 内核,前向快 FA4 约 13%、反向快 50%

AI 导读

PyTorch 团队发布博客,介绍为 Meta 生成式广告模型 GEM 打造的注意力内核 JFA(Jagged Flash Attention)在 NVIDIA Blackwell B200 上的实现与优化。

来源:AGI Hunt · agihunt.info