跳到正文
热点事件持续更新

双RTX 6000 Pro自托管GLM实测175 tok/s

2 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月2日,AGI Hunt 报道称,网友 HankYeomans 分享自托管 GLM 模型的本地部署数据:在双 RTX 6000 Pro 上采用推测性解码,生成速度达 175 tok/s,草稿接受率高达 98%,prompt 吞吐同样表现良好。该报道中模型型号写作 GLM-5.3-EX3,但标明尚待证实,型号名称疑为笔误;发帖人自己称这个数字「ridiculous」,相关数据也未经证实。同日稍后,AGI Hunt 再发一条同源报道,内容与首条一致,仍强调型号待证实、数据未经验证,未提供额外细节。该数据展示了消费级工作站硬件自托管大模型的可能性,同时引发社区对模型真实身份与部署细节的关注。截至当前,仅有 AGI Hunt 一家来源的这两条同日报道,暂无后续进展或官方回应。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AGI Hunt
    网友称自托管 GLM 模型在双 RTX 6000 Pro 上跑出 175 tok/s、98% 草稿接受率

    网友 HankYeomans 分享本地部署数据:疑似 GLM 模型(写作 GLM-5.3-EX3,型号名待证实)在两块 RTX 6000 Pro 上达到 175 tok/s,搭配投机解码的草稿接受率高达 98%。发帖人自己称这个数字「ridiculous」。该型号名称疑为笔误,数据未经证实。

  2. AGI Hunt
    网友实测自托管 GLM 模型:双 RTX 6000 Pro 跑出 175 tok/s

    网友 HankYeomans 实测自托管 GLM 模型(型号写作 GLM-5.3-EX3,尚待证实)在双 RTX 6000 Pro 上采用推测性解码,生成速度达 175 tok/s,草稿接受率 98%,prompt 吞吐同样表现良好。该数据展示了消费级工作站硬件自托管大模型的可能性,也引发社区对模型真实身份与部署细节的关注。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。