Command Palette
Search for a command to run...
Tutoriel En Ligne | Compressez Un Modèle De 27 Octets À 7,2 Go ! Ternary-Bonsai Utilise La « Magie Ternaire » Pour Faire Fonctionner Les Grands Modèles Sur Les Ordinateurs personnels.

À mesure que les capacités des modèles de langage à grande échelle (LLM) évoluent, leur taille augmente également, les centaines de milliards de paramètres devenant la norme. Cependant, ces capacités accrues s'accompagnent souvent de barrières à l'entrée plus élevées : les exigences en matière de mémoire GPU et de ressources de calcul (plusieurs dizaines de gigaoctets) contraignent la plupart des développeurs à se tourner vers le cloud.
L'équipe Prism ML a lancé Ternary-Bonsai-27B, un modèle de langage à grande échelle de niveau 27B avec un raisonnement efficace en son cœur.Ce modèle cible ce problème. Basé sur l'architecture Qwen3.6-27B, il utilise une technologie de quantification ternaire de bout en bout pour compresser les poids du modèle en trois états : {-1, 0, +1}. Combiné au mécanisme de mise à l'échelle par lots FP16, il réduit considérablement la taille du modèle tout en préservant au maximum ses capacités.
L'effet de compression est assez direct :Le modèle original 27B, qui faisait environ 54 Go, a été compressé à 7,2 Go, réduisant sa taille d'environ 9,4 fois, tout en conservant environ 95% de performances FP16.Les modèles de grande taille qui nécessitaient auparavant des serveurs haute performance peuvent désormais être déployés avec un seul GPU, voire un ordinateur portable.
Outre la compression du modèleLe Ternary-Bonsai-27B a également été optimisé pour les contextes longs et l'efficacité d'inférence.Le modèle utilise une architecture d'attention hybride, déchargeant environ 751 TP3T de calcul vers une attention linéaire plus efficace tout en conservant certains mécanismes d'attention complète pour gérer les sémantiques complexes et prendre en charge des contextes allant jusqu'à 262 000 jetons. Lors du traitement de textes longs de 100 000 jetons, la consommation mémoire maximale n'est que d'environ 14,7 Go. Le moteur de décodage DSpark associé améliore la vitesse de génération d'environ 1,34 fois et est compatible avec divers environnements d'exécution, notamment CUDA, Metal et le CPU.
Ternary-Bonsai-27B est désormais disponible sur HyperAI (hyper.ai), avec un déploiement en un clic et une invocation rapide, permettant aux développeurs de faciliter l'accès aux grands modèles et de démarrer rapidement le développement d'applications d'IA. ⬇️
Exécutez en ligne :https://go.hyper.ai/V4fXi

Plus de tutoriels en ligne :
Essai de démonstration
1. Après avoir accédé à la page d'accueil hyper.ai, sélectionnez la page « Tutoriels », ou cliquez sur « Voir plus de tutoriels », sélectionnez « Ternary-Bonsai-27B : 7,2 Go Ternary Quantization Inference 27B », et cliquez sur « Exécuter ce tutoriel ».



2. Une fois la page redirigée, cliquez sur « Cloner » en haut à droite pour cloner le tutoriel dans votre propre conteneur.
Remarque : Vous pouvez changer de langue en haut à droite de la page. Actuellement, le chinois et l’anglais sont disponibles. Ce tutoriel présente les étapes en anglais.

3. Sélectionnez les images « NVIDIA RTX 5090 » et « PyTorch », puis cliquez sur « Continuer l'exécution de la tâche ».


4. Attendez que les ressources soient allouées. Une fois que le statut passe à « En cours d'exécution », cliquez sur « Ouvrir l'espace de travail » pour accéder à l'espace de travail Jupyter.

Affichage des effets
1. Une fois la page redirigée, cliquez sur le fichier README à gauche, puis sur « Exécuter » en haut.


2. Une fois le processus terminé, cliquez sur l'adresse API à droite pour ouvrir l'interface de démonstration.









