跳到正文
原文
AGI Hunt· ngxson·· 9 小时前AI 评分44

RTX 5060 Ti 实测:Clef Flash 9B Q8_0 在 llama.cpp 上快约 30%

RTX 5060 Ti 实测:Clef Flash 9B Q8_0 llama.cpp 快 30%

AI 导读

ngxson 在 RTX 5060 Ti 上以 Q8_0 量化全本地运行 Clef Flash 9B,llama.cpp 的 prompt 评估快约 30%。速度约 3000 tokens/s 对 2100 tokens/s,文本和单图输入上差距相同。作者附上可复现命令 ollama run clef-flash:9b-q80 与 llama-server -b 8192。

来源:AGI Hunt · agihunt.info