跳到正文
原文
Hugging Face Blog·· 11 天前精选AI 评分73

Transformers加入GGUF模型支持以运行llama.cpp量化检查点

Transformers now runs llama.cpp quants

AI 导读

Transformers加入对GGUF模型的支持,可通过from_pretrained加载Hub中的GGUF检查点,并在熟悉的Python与PyTorch API中使用。当前打包推理路径仅支持Apple Silicon的MPS,覆盖Qwen3.5稠密与MoE架构及兼容的Qwen3.8检查点;若量化内核不可获取,则回退到sdpa或反量化路径。

推荐理由

GGUF支持把llama.cpp生态中的量化检查点接入transformers的PyTorch工作流,但当前集中于Apple Silicon的MPS与有限架构,评估本地部署时仍需核对兼容性和基准条件。

来源:Hugging Face Blog · huggingface.co