跳到正文
原文
AGI Hunt· Postmodern_Plunger·· 4 小时前AI 评分59

前 SWE 转推理工程师:Ollama 从不最优,运行时与量化避坑指南

AI 导读

一位从软件工程师转做推理工程的全职从业者总结了社区里常见的推理配置错误,认为 Ollama 从不是最优,只是最简单、适合内存充裕的快速上手场景。他建议需要 CPU offload 时选 llama.cpp,纯 GPU 场景 VLLM 通常最好,工作流涉及 Langgraph 可考虑 SGLang,并强调必须用硬件特定编译标志编译、系统或驱动更新后重编译。

来源:AGI Hunt · agihunt.info