跳到正文
原文
AGI Hunt· NoFee9147·· 3 小时前AI 评分39

四卡 7900XTX 跑 Qwen3.8-27B 提速近一倍,作者公开 20 余项 ROCm 优化

四卡 7900XTX 跑 27B 提速近一倍,作者公开 20 余项 ROCm 优化

AI 导读

有人用 Claude 协助为 ROCm 和 llama.cpp 做了 20 余项底层优化,在 4 张 7900XTX 上运行 Qwen3.8-27B Q8,代码生成解码从 54-61 提升到 96-110 tok/s,51K 上下文预填充从 1454 提升到 1816 tok/s。

来源:AGI Hunt · agihunt.info