AGI Hunt· rohanpaul_ai·· 5 小时前AI 评分38
Cerebras CEO 揭秘:晶圆级架构推理为何比 GPU 快 2500 倍
AI 导读
Cerebras 联合创始人兼 CEO Andrew Feldman 在 The MAD Podcast 上解释,其晶圆级架构在 LLM 推理时比 GPU 快 2500 倍。他把差异归结于权重存放位置:GPU 的权重放在 HBM,Cerebras 则把权重放在分布式的晶圆级处理器 SRAM 中,使 decode 阶段每生成一个 token 必需的「内存→计算」搬运快约 2500 倍。
来源:AGI Hunt · agihunt.info