HyperAIHyperAI

Command Palette

Search for a command to run...

オンラインチュートリアル | 27B の大きなモデルを 7.2GB に圧縮! Ternary-Bonsai は「三進法の魔法」を使って、大きなモデルをパーソナルコンピュータで実行できるようにします。

Featured Image

大規模言語モデル(LLM)の機能が進化し続けるにつれ、これらのモデルの規模も拡大しており、数千億個のパラメータが標準になりつつあります。しかし、機能の向上は多くの場合、導入の障壁を高めます。数十ギガバイトのGPUメモリと計算リソースの要件により、ほとんどの開発者はクラウド環境に限定されています。

Prism MLチームは、効率的な推論を中核とする27Bレベルの大規模言語モデルであるTernary-Bonsai-27Bを発表しました。このモデルは、まさにこの課題を解決することを目的としています。Qwen3.6-27Bアーキテクチャをベースに、エンドツーエンドの三値量子化技術を用いてモデルの重みを{-1, 0, +1}の3つの状態に圧縮します。FP16バッチスケーリング機構と組み合わせることで、元のモデルの機能を可能な限り維持しながら、モデルサイズを大幅に削減します。

圧縮効果は非常に直接的です。元の27Bモデルは、約54GBでしたが、7.2GBに圧縮され、サイズは約9.4分の1に縮小されました。しかも、FP16性能は約95%を維持しています。従来は高性能サーバーを必要としていた大規模モデルも、今では単一のGPU、あるいはノートパソコンでも展開できるようになった。

モデル圧縮に加えてTernary-Bonsai-27Bは、長いコンテキストと推論効率についても最適化されています。このモデルはハイブリッドアテンションアーキテクチャを採用しており、約75%の計算をより効率的な線形アテンションにオフロードしつつ、複雑な意味を処理するために一部のフルアテンションメカニズムを保持し、最大262Kトークンのコンテキストをサポートします。100Kトークンの長文テキストを処理する場合、ピーク時のメモリ使用量は約14.7GBにとどまります。付属のDSparkデコードエンジンは、生成速度を約1.34倍向上させ、CUDA、Metal、CPUなど、さまざまな実行環境に対応しています。

Ternary-Bonsai-27BがHyperAI(hyper.ai)で利用可能になりました。ワンクリックでのデプロイと迅速な呼び出しに対応しており、開発者が大規模モデルを使用する際の障壁を下げ、AIアプリケーション開発を迅速に開始できるよう支援します。⬇️

オンラインで実行:https://go.hyper.ai/V4fXi

デモ例

その他のオンラインチュートリアル:

https://hyper.ai/notebooks

デモの実行

1. hyper.ai のホームページにアクセスした後、「チュートリアル」ページを選択するか、「その他のチュートリアルを表示」をクリックし、「Ternary-Bonsai-27B: 7.2GB Ternary Quantization Inference 27B」を選択して、「このチュートリアルを実行」をクリックします。

2. ページがリダイレクトされたら、右上隅の「複製」をクリックして、チュートリアルを独自のコンテナーに複製します。

注:ページの右上で言語を切り替えることができます。現在、中国語と英語が利用可能です。このチュートリアルでは英語で手順を説明します。

3. 「NVIDIA RTX 5090」と「PyTorch」の画像を選択し、「ジョブの実行を続行」をクリックします。

4. リソースが割り当てられるのを待ちます。ステータスが「実行中」に変わったら、「ワークスペースを開く」をクリックしてJupyterワークスペースに入ります。

エフェクト表示

1. ページがリダイレクトされたら、左側のREADMEファイルをクリックし、上部の「実行」をクリックします。

2. 処理が完了したら、右側のAPIアドレスをクリックしてデモインターフェースを開きます。