HyperAIHyperAI

Command Palette

Search for a command to run...

TurboFieldfare fait tourner Gemma 4 26B sur 2 Go de RAM

Un ingénieur iOS et développeur spécialisé en Metal, Andrey Mikhaylov, a publié un moteur d'inférence open source nommé TurboFieldfare. Ce projet permet d'exécuter le grand modèle de langage Gemma 4 26B-A4B sur des Mac à puce Apple Silicon équipés de seulement 8 Go de mémoire vive, avec une utilisation mémoire d'environ 2 Go. Cette performance s'oppose aux exigences traditionnelles des modèles de cette taille, qui nécessitent généralement plus de 14 Go de RAM pour fonctionner correctement. La technique repose sur un runtime développé intégralement en Swift et Metal. Au lieu de charger l'intégralité des poids du modèle en mémoire, le système conserve un noyau partagé d'environ 1,35 Go ainsi que le cache des états intermédiaires en format FP16. Pour chaque token généré, il récupère à la demande uniquement les modules réseau nécessaires depuis le SSD du Mac, en s'appuyant sur un cache limité et des appels parallèles optimisés. Le prétraitement des invites utilise des blocs de tokens, tandis que la génération s'effectue token par token. Cette architecture a été éprouvée à travers plus d'une centaine de configurations testées pour optimiser les noyaux Metal, la gestion du cache et les performances d'entrée-sortie. Les résultats mesurés indiquent un débit de 5,1 à 6,3 tokens par seconde sur un MacBook Air M2 à 8 Go, et de 31 à 35 tokens par seconde sur un MacBook Pro M5 Pro à 24 Go. Ces chiffres constituent des références sous conditions réelles, la vitesse variant selon la longueur des invites, l'état du cache et les spécificités matérielles. L'outil propose une application macOS native, une interface en ligne de commande et un serveur local compatible avec l'API OpenAI. Lors de l'installation, le gestionnaire télécharge et repackage les poids du modèle en format propriétaire .gturbo, évitant ainsi de stocker temporairement l'intégralité des 15 Go sur le disque. TurboFieldfare se limite actuellement à l'inférence textuelle pour les modèles instruction-tuned. Il prend en charge le formatage automatique des conversations, la configuration de la température et des paramètres d'échantillonnage, ainsi que la déclaration d'outils via le serveur local, bien que l'exécution reste à la charge du client. Le code source est publié sous licence Apache 2.0, tandis que les poids du modèle restent soumis aux conditions de leur détenteur initial. Le projet se présente comme une initiative de recherche indépendante, sans lien avec Google. Cette solution démontre qu'il est possible de déployer des modèles performants sur des matériels grand public, en optimisant l'utilisation de la mémoire et en tirant parti des accélérateurs matériels Apple. TurboFieldfare offre aux développeurs et aux utilisateurs une alternative locale pour expérimenter l'intelligence artificielle générative sans dépendre de connexions cloud ou de machines haute gamme.

Liens associés

TurboFieldfare fait tourner Gemma 4 26B sur 2 Go de RAM | Trending Stories | HyperAI