Hugging Face Blog·· 14 天前精选AI 评分72
Transformers 现已支持运行 llama.cpp 的 GGUF 量化模型
Transformers now runs llama.cpp quants
AI 导读
Hugging Face 为 transformers 加入 GGUF 模型支持,用户可通过 from_pretrained 传入 gguf_file 在 Apple Silicon 上运行 llama.cpp 的量化模型。
推荐理由
transformers 复用 llama.cpp 的 ggml kernel 直接加载 GGUF,读者可据此判断本地量化推理接入 PyTorch 工作流的成本。
来源:Hugging Face Blog · huggingface.co