HyperAIHyperAI

Command Palette

Search for a command to run...

Hugging Face publie 207 kernels WebGPU pour l'IA locale

Hugging Face annonce le lancement de @huggingface/kernels, une bibliothèque et un ensemble de 207 kernels WebGPU destinés à accélérer l'inférence d'intelligence artificielle directement dans le navigateur. Développée par l'équipe WebAI de l'entreprise, cette initiative vise à rendre le calcul local sur le web aussi performant et accessible que possible. L'inférence en navigateur repose sur une série d'opérations graphiques fondamentales. Si WebGPU assure une large compatibilité entre les navigateurs, il ne garantit pas automatiquement une vitesse optimale. C'est pourquoi Hugging Face publie ces kernels comme des unités logicielles indépendantes et versionnées. Chaque kernel est hébergé dans un dépôt dédié sur le Hub, incluant son interface, ses shaders de programmation graphique, ainsi que des tests de vérification et des benchmarks. Cette structure permet aux développeurs d'inspecter, de tester et d'intégrer facilement les opérations sans modifier l'interface de leurs applications. Pour faciliter l'utilisation, la bibliothèque @huggingface/kernels propose un chargeur JavaScript simple. Il suffit de spécifier l'identifiant du dépôt et la version du contrat pour récupérer et exécuter le kernel, que ce soit pour une simple addition de tenseurs ou des calculs matriciels complexes. Les kernels incluent automatiquement des variantes adaptées à différentes tailles de données et configurations matérielles, ce qui simplifie considérablement leur déploiement. Afin de valider ces performances dans des conditions réelles, Hugging Face a également déployé Fleet, un outil de benchmarking intégré au navigateur. Il permet aux utilisateurs de tester les kernels sur leur propre matériel et de contribuer anonymement à une base de données collective. Cette approche collaborative aide l'équipe à identifier les problèmes spécifiques à certains GPU, navigateurs ou pilotes, et à optimiser les algorithmes en conséquence. Les premiers résultats sont encourageants. Sur un processeur graphique Apple M4, les kernels Hugging Face se montrent en moyenne 2,57 fois plus rapides que ceux d'ORT WebGPU, avec des gains significatifs sur des cas particuliers. Ces tests mesurent uniquement le temps de calcul pur sur le GPU, excluant les étapes de chargement ou de compilation, mais ils soulignent le potentiel d'une optimisation fine au niveau basal. Cette collection de 207 kernels, sous licence Apache 2.0, constitue la première pierre d'une infrastructure plus large pour l'IA dans le web. Hugging Face travaille déjà avec l'équipe d'ONNX Runtime pour intégrer ces améliorations à l'écosystème plus vaste. En fournissant une fondation transparente et testable, l'entreprise entend simplifier le déploiement de modèles locaux sur le web et préparer les prochaines étapes de son développement WebAI.

Liens associés