跳到正文
原文
AGI Hunt· rohanpaul_ai·· 5 小时前AI 评分38

Cerebras CEO 揭秘:晶圆级架构推理为何比 GPU 快 2500 倍

AI 导读

Cerebras 联合创始人兼 CEO Andrew Feldman 在 The MAD Podcast 上解释,其晶圆级架构在 LLM 推理时比 GPU 快 2500 倍。他把差异归结于权重存放位置:GPU 的权重放在 HBM,Cerebras 则把权重放在分布式的晶圆级处理器 SRAM 中,使 decode 阶段每生成一个 token 必需的「内存→计算」搬运快约 2500 倍。

来源:AGI Hunt · agihunt.info