HyperAIHyperAI

Command Palette

Search for a command to run...

Transformers unterstützt nun llama.cpp-Quants

Hugging Face hat die Unterstützung für GGUF-Modelle in seiner Open-Source-Bibliothek transformers integriert. Damit können Entwickler quantisierte Checkpoints direkt über die bewährte API laden und auf lokalen Geräten ausführen, ohne auf dedizierte Inferenz-Engines wie llama.cpp angewiesen zu sein. Der Fokus der ersten Implementierung liegt auf der Beschleunigung auf Apple Silicon. Die Integration nutzt die kernels-Bibliothek, um Optimierungen aus dem ggml-Ökosystem nahtlos in PyTorch zu übernehmen. Zu den implementierten Komponenten zählen metall-spezifische Kernels für Quantisierung, Normalisierung, Flash-Attention sowie optimierte Routing-Mechanismen für Mixture-of-Experts-Modelle. Dadurch entfällt die traditionelle Entpackung der Gewichte vor jeder Berechnung, was den Arbeitsspeicherverbrauch und die Latenz erheblich reduziert. Ein modifizierter Generierungs-Loop minimiert zudem unnötige CPU-GPU-Synchronisationen, wodurch die Durchsatzraten gesteigert werden. Nutzer laden GGUF-Dateien standardmäßig über die Methode from_pretrained mit Angabe der entsprechenden Datei. Bei kompatiblen Kernels erfolgt die Ausführung automatisch über die Metal-Backend-Implementierung, andernfalls wird auf eine Standard-SDPA-Lösung zurückgegriffen. Die Bibliothek unterstützt eine Palette an Quantisierungsstufen. Empfohlen wird Q4_K_M als guter Kompromiss zwischen Speicherbedarf und Modelligkeit, während bei mehr verfügbarem RAM Q5_K_M oder Q6_K bevorzugt werden sollten. Für den produktiven Einsatz steht zudem ein Befehlszeilen-Tool zur Verfügung, das eine OpenAI-kompatible API bereitstellt und die Integration in lokale Client-Anwendungen ermöglicht. Unabhängige Benchmarks auf einem MacBook Pro mit M2-Max-Chip belegen, dass die Inferenzgeschwindigkeit in der Token-Generierung nahe an der von llama.cpp liegt. Hugging Face betont, dass die native GGUF-Unterstützung die beiden bisherigen Ökosysteme ergänzen soll: llama.cpp bleibt die Empfehlung für hardwareoptimierte Standardinferenz, während transformers durch den Kernel-Zugriff nun auch komplexe Quantisierungen in einem einheitlichen Python-Framework ermöglicht. Über den reinen GGUF-Import hinaus markiert die Kernel-Integration einen strategischen Schritt für die Zukunft der Bibliothek. Die wiederverwendbaren Operationen sollen in Zukunft auch in anderen Modellarchitekturen eingesetzt werden, die noch keine dedizierte llama.cpp-Implementierung besitzen. Dies eröffnet Perspektiven für die Beschleunigung neuer Forschungsmodelle sowie künftiger Multimodal-Modelle. Die aktuelle Version steht seit April 2026 Entwicklern zur Verfügung, wobei die Unterstützung weiterer Modelltypen kontinuierlich priorisiert wird.

Verwandte Links