HyperAIHyperAI

Command Palette

Search for a command to run...

Hugging Face veröffentlicht 200+ WebGPU-Kernels für KI

Hugging Face hat mit @huggingface/kernels eine neue Open-Source-Bibliothek und eine Sammlung von 207 WebGPU-Kernels veröffentlicht, um die Performance von lokal ausgeführten KI-Modellen direkt im Browser zu optimieren. Die Initiative des WebAI-Teams von Hugging Face adressiert eine zentrale Herausforderung der Web-Entwicklung: Web-GPU-Schnittstellen gewährleisten zwar Portabilität, doch die tatsächliche Ausführungsleistung variiert stark je nach Hardware, Treiber und Browser-Implementierung. Die neu eingeführten Kernels bilden daher die unterste, kritische Schicht der Browser-Inferenz-Stacks. Jeder Kernel wird als eigenständiges, versioniertes Repository auf dem Hugging Face Hub veröffentlicht und enthält nicht nur die WGSL-Shader-Vorlagen, sondern auch Manifeste, Korrektheitstests, Benchmark-Daten und detaillierte Dokumentation. Über das npm-Paket @huggingface/kernels lassen sich diese Operationen direkt in JavaScript-Anwendungen laden. Die Schnittstelle nutzt explizite Verträge, die Eingabeformen, Datentypen und Ausgabegestalten automatisch ableiten. Durch das Vorsehen mehrerer Varianten pro Operation ermöglicht die Laufzeit eine adaptive Auswahl der optimalen Implementierung, ohne die Anwendungs-API zu ändern. Zur Validierung und kontinuierlichen Verbesserung der Kernel stellt Hugging Face gleichzeitig die Browseranwendung Fleet vor. Dieses Tool ermöglicht es Nutzerinnen und Nutzern, Performance- und Korrektheitstests auf ihrer lokalen Hardware durchzuführen. Die anonymisierten Ergebnisse werden der Community als Benchmarkbasis zur Verfügung gestellt und helfen dabei, gerätespezifische Engpässe zu identifizieren, Optimierungsentscheidungen zu treffen und die Variantenverwaltung weiter zu verfeinern. Erste Benchmarks auf Apple-M4-GPUs zeigen deutliche Leistungssteigerungen gegenüber der bestehenden ORT WebGPU-Implementierung. Bei der Überprüfung von 809 übereinstimmenden Testfällen erreichten die Hugging-Face-Kernels ein geometrisches Mittel der Geschwindigkeit von 2,57-fach und einen Median von 1,90-fach. Besonders bei spezialisierten Operationen wie bilinearem Einsum oder zeilenbasierten Kumulationsaufgaben wurden Mehrfaches bis Zehntausendfaches höhere Geschwindigkeiten gemessen. Die gemessenen Zeiten beziehen sich ausschließlich auf die reine GPU-Ausführung und schalten Lade- sowie Compilierungsvorgänge aus. Die 207 Kernels sind unter der Apache-2.0-Lizenz verfügbar und decken eine breite Palette maschineller Lernarchitekturen ab, darunter Matrixmultiplikationen, Normalisierungen, Faltungsschichten und Quantifizierungsoperationen. Hugging Face arbeitet parallel mit dem ONNX Runtime Team zusammen, um die Optimierungen in die breitere ONNX Runtime Web-Ökosystem zu überführen. Die WebGPU-Kernels ergänzen bereits existierende Kernel für CUDA, ROCm und Metal im Hub-Katalog. Mit der Veröffentlichung dieser Standardisierung wird die Grundlage für eine zuverlässigere, performantere und zugänglichere KI-Inferenz im Web gelegt. Die Sammlung dient als Startpunkt für die weitere Entwicklung des WebAI-Ökosystems, wobei zukünftige Updates die Abdeckung komplexerer Modelle und die Integration in höherstufige Modelltools anstreben.

Verwandte Links