热点事件持续更新
llama.cpp prompt 评估快过 Ollama 30%
2 篇报道1 个报道来源8 小时前更新
先了解这件事
AI 综述
2026年10月6日,AGI Hunt 报道称,开发者 ngxson 在 RTX 5060 Ti 上做本地推理实测:以 Q8_0 量化、完全本地运行 Clef Flash 9B 模型,测得 llama.cpp 的 prompt 评估速度约 3000 tokens/s,Ollama 约 2100 tokens/s,前者比后者快约 30%。同日后续报道补充称,在文本和单图输入上两者的差距相同,作者还附上了可复现命令:ollama run clef-flash:9b-q80 与 llama-server -b 8192。报道未披露测试所用模型版本、运行环境细节与重复次数等信息。截至目前,该事件仅有 AGI Hunt 一家来源,尚无其他来源交叉验证或后续复现结果;两篇报道在数字与说法上一致,未出现早先报道与后续报道相互矛盾之处。
AI 根据报道生成 · 55 分钟前更新
最新进展10月6日 05:51
新报道补充称文本与单图输入上差距相同,并给出可复现命令。报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- AGI Huntngxson 实测 RTX 5060 Ti,llama.cpp 跑 Clef Flash 9B 的 prompt 评估比 Ollama 快约 30%
开发者 ngxson 在 RTX 5060 Ti 上以 Q8_0 量化全本地运行 Clef Flash 9B,实测 llama.cpp 的 prompt 评估约 3000 tokens/s,Ollama 约 2100 tokens/s,前者快约 30%。
- AGI HuntRTX 5060 Ti 实测:Clef Flash 9B Q8_0 在 llama.cpp 上快约 30%
ngxson 在 RTX 5060 Ti 上以 Q8_0 量化全本地运行 Clef Flash 9B,llama.cpp 的 prompt 评估快约 30%。速度约 3000 tokens/s 对 2100 tokens/s,文本和单图输入上差距相同。作者附上可复现命令 ollama run clef-flash:9b-q80 与 llama-server -b 8192。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。