HyperAIHyperAI

Command Palette

Search for a command to run...

Transformers现支持高效运行llama.cpp量化模型

Hugging Face官方近日宣布,其核心模型库Transformers已正式兼容GGUF量化格式。此举旨在通过复用llama.cpp底层ggml内核的新版kernels库,大幅降低本地化AI推理门槛。开发者无需切换推理引擎,即可在熟悉的API生态中直接调用平台上的GGUF权重文件,实现高效本地部署。 该功能首批聚焦Apple Silicon硬件,已适配Qwen3.5等架构。通过引入ggml-quantization与ggml-attn等专用Metal内核,并结合优化后的生成循环以减少CPU与GPU同步开销,Transformers在MacBook Pro M2 Max上的实测吞吐量已逼近专用llama.cpp引擎。官方建议用户从Q4_K_M量化版本起步,以平衡显存占用与生成质量。此外,库内新增的serve模块支持一键启动兼容OpenAI协议的本地API,方便快速对接主流客户端。 此举标志着Hugging Face进一步强化其本地AI战略。llama.cpp与GGML加入平台后,两者将形成“本地高效推理”与“模型架构定义”的互补生态。未来,该内核技术将逐步扩展至多模态与非GGUF架构,推动高性能本地推理成为开发常态。当前版本优先保障单轮交互体验,社区正根据实际用例持续拓展支持范围。

相关链接