跳到正文
原文
Hugging Face Blog·· 14 天前精选AI 评分72

Transformers 现已支持运行 llama.cpp 的 GGUF 量化模型

Transformers now runs llama.cpp quants

AI 导读

Hugging Face 为 transformers 加入 GGUF 模型支持,用户可通过 from_pretrained 传入 gguf_file 在 Apple Silicon 上运行 llama.cpp 的量化模型。

推荐理由

transformers 复用 llama.cpp 的 ggml kernel 直接加载 GGUF,读者可据此判断本地量化推理接入 PyTorch 工作流的成本。

来源:Hugging Face Blog · huggingface.co