AGI Hunt· HankYeomans·· 4 小时前AI 评分31
网友实测自托管 GLM 模型:双 RTX 6000 Pro 跑出 175 tok/s
AI 导读
网友 HankYeomans 实测自托管 GLM 模型(型号写作 GLM-5.3-EX3,尚待证实)在双 RTX 6000 Pro 上采用推测性解码,生成速度达 175 tok/s,草稿接受率 98%,prompt 吞吐同样表现良好。该数据展示了消费级工作站硬件自托管大模型的可能性,也引发社区对模型真实身份与部署细节的关注。
来源:AGI Hunt · agihunt.info