HyperAIHyperAI

Command Palette

Search for a command to run...

Online-Tutorial | Komprimieren Sie Ein 27 Byte Großes Modell Auf 7,2 GB! Ternary-Bonsai Nutzt „ternäre Magie“, Um Große Modelle Auf PCs Lauffähig Zu machen.

Featured Image

Mit der Weiterentwicklung der Leistungsfähigkeit großer Sprachmodelle (LLMs) wächst auch deren Umfang, wobei Hunderte von Milliarden Parametern mittlerweile Standard sind. Höhere Leistungsfähigkeit bedeutet jedoch oft auch höhere Implementierungshürden: Der Bedarf an mehreren zehn Gigabyte GPU-Speicher und Rechenressourcen hält die meisten Entwickler weiterhin von der Cloud fern.

Das Prism ML-Team hat Ternary-Bonsai-27B vorgestellt – ein groß angelegtes Sprachmodell der Stufe 27B mit effizientem Schließen im Kern.Dieses Modell zielt auf diese Schwachstelle ab. Basierend auf der Qwen3.6-27B-Architektur nutzt es eine durchgängige ternäre Quantisierungstechnologie, um die Modellgewichte in drei Zustände zu komprimieren: {-1, 0, +1}. In Kombination mit dem FP16-Batch-Skalierungsmechanismus reduziert es die Modellgröße signifikant und erhält dabei die ursprünglichen Funktionen weitestgehend.

Der Kompressionseffekt ist ziemlich direkt:Das ursprüngliche 27B-Modell, das etwa 54 GB groß war, wurde auf 7,2 GB komprimiert, wodurch sich seine Größe um etwa das 9,4-fache verringerte, während die FP16-Leistung von etwa 95% erhalten blieb.Große Modelle, für deren Betrieb bisher Hochleistungsserver erforderlich waren, können jetzt mit einer einzelnen GPU oder sogar einem Laptop eingesetzt werden.

Neben der ModellkomprimierungDer Ternary-Bonsai-27B wurde außerdem für lange Kontexte und Inferenzeffizienz optimiert.Das Modell nutzt eine hybride Aufmerksamkeitsarchitektur, die etwa 751 TP3 T an effizientere lineare Aufmerksamkeit auslagert und gleichzeitig vollständige Aufmerksamkeitsmechanismen zur Verarbeitung komplexer Semantik beibehält. Es unterstützt Kontexte mit bis zu 262.000 Token. Bei der Verarbeitung langer Texte mit 100.000 Token beträgt die maximale Speichernutzung lediglich etwa 14,7 GB. Die zugehörige DSpark-Dekodierungs-Engine verbessert die Generierungsgeschwindigkeit um etwa das 1,34-Fache und ist mit verschiedenen Laufzeitumgebungen wie CUDA, Metal und CPU kompatibel.

Ternary-Bonsai-27B ist jetzt auf HyperAI (hyper.ai) verfügbar und unterstützt die Bereitstellung mit einem Klick sowie den schnellen Aufruf. Dies hilft Entwicklern, die Einstiegshürde für die Verwendung großer Modelle zu senken und schnell mit der KI-Anwendungsentwicklung zu beginnen. ⬇️

Online ausführen:https://go.hyper.ai/V4fXi

Demobeispiel

Weitere Online-Tutorials:

https://hyper.ai/notebooks

Demolauf

1. Nachdem Sie die Hyper.ai-Homepage aufgerufen haben, wählen Sie die Seite „Tutorials“ aus oder klicken Sie auf „Weitere Tutorials anzeigen“, wählen Sie „Ternary-Bonsai-27B: 7.2GB Ternary Quantization Inference 27B“ aus und klicken Sie auf „Dieses Tutorial ausführen“.

2. Nachdem die Seite weitergeleitet wurde, klicken Sie oben rechts auf „Klonen“, um das Tutorial in Ihren eigenen Container zu klonen.

Hinweis: Sie können die Sprache oben rechts auf der Seite ändern. Derzeit sind Chinesisch und Englisch verfügbar. Dieses Tutorial zeigt die Schritte auf Englisch.

3. Wählen Sie die Images „NVIDIA RTX 5090“ und „PyTorch“ aus und klicken Sie auf „Auftragsausführung fortsetzen“.

4. Warten Sie, bis die Ressourcen zugewiesen wurden. Sobald sich der Status auf „Wird ausgeführt“ ändert, klicken Sie auf „Arbeitsbereich öffnen“, um den Jupyter-Arbeitsbereich zu betreten.

Effektanzeige

1. Nachdem die Seite weitergeleitet wurde, klicken Sie auf die README-Datei auf der linken Seite und anschließend oben auf Ausführen.

2. Nach Abschluss des Vorgangs klicken Sie auf die API-Adresse auf der rechten Seite, um die Demo-Oberfläche zu öffnen.