Command Palette
Search for a command to run...
온라인 튜토리얼 | 27GB 크기의 모델을 7.2GB로 압축하세요! Ternary-Bonsai는 "삼진법 마법"을 사용하여 대용량 모델을 개인용 컴퓨터에서 실행할 수 있도록 합니다.

대규모 언어 모델(LLM)의 기능이 지속적으로 발전함에 따라 모델의 규모 또한 확장되어 수천억 개의 매개변수가 일반화되고 있습니다. 그러나 기능이 향상될수록 배포 장벽도 높아지는 경우가 많습니다. 수십 기가바이트에 달하는 GPU 메모리와 컴퓨팅 리소스 요구 사항으로 인해 대부분의 개발자는 클라우드 환경에 국한되어 있습니다.
Prism ML 팀은 효율적인 추론을 핵심으로 하는 270억 규모의 대규모 언어 모델인 Ternary-Bonsai-27B를 출시했습니다.이 모델은 이러한 문제점을 해결하기 위해 개발되었습니다. Qwen3.6-27B 아키텍처를 기반으로, 종단 간 3진 양자화 기술을 사용하여 모델 가중치를 {-1, 0, +1}의 세 가지 상태로 압축합니다. FP16 배치 스케일링 메커니즘과 결합하여, 기존 모델의 기능을 최대한 유지하면서 모델 크기를 크게 줄입니다.
압축 효과는 매우 직접적입니다.기존 27B 모델은 약 54GB였지만, 7.2GB로 압축되어 크기가 약 9.4배 줄어들었으며, FP16 성능은 약 95%를 유지합니다.이전에는 고성능 서버가 필요했던 대형 모델도 이제는 단일 GPU 또는 노트북만으로도 배포할 수 있습니다.
모델 압축 외에도Ternary-Bonsai-27B는 긴 컨텍스트와 추론 효율성에 최적화되어 있습니다.이 모델은 하이브리드 어텐션 아키텍처를 채택하여 약 75%의 연산량을 보다 효율적인 선형 어텐션으로 분산시키는 동시에 복잡한 의미론적 처리를 위해 일부 완전한 어텐션 메커니즘을 유지하며, 최대 262,000개의 토큰으로 구성된 컨텍스트를 지원합니다. 100,000개의 토큰으로 이루어진 긴 텍스트를 처리할 때 최대 메모리 사용량은 약 14.7GB에 불과합니다. 함께 제공되는 DSpark 디코딩 엔진은 생성 속도를 약 1.34배 향상시키며 CUDA, Metal, CPU를 포함한 다양한 런타임 환경과 호환됩니다.
Ternary-Bonsai-27B가 HyperAI(hyper.ai)에서 제공됩니다. 원클릭 배포 및 빠른 실행을 지원하여 개발자가 대규모 모델 사용에 대한 진입 장벽을 낮추고 AI 애플리케이션 개발을 신속하게 시작할 수 있도록 도와줍니다. ⬇️
온라인으로 실행:https://go.hyper.ai/V4fXi

데모 실행
1. hyper.ai 홈페이지에 접속한 후 "튜토리얼" 페이지를 선택하거나 "더 많은 튜토리얼 보기"를 클릭하고 "Ternary-Bonsai-27B: 7.2GB Ternary Quantization Inference 27B"를 선택한 다음 "이 튜토리얼 실행"을 클릭합니다.


2. 페이지가 리디렉션된 후 오른쪽 상단의 "복제"를 클릭하여 튜토리얼을 자신의 컨테이너로 복제합니다.
참고: 페이지 오른쪽 상단에서 언어를 변경할 수 있습니다. 현재 중국어와 영어로만 제공됩니다. 이 튜토리얼에서는 영어로 된 단계를 안내합니다.
3. "NVIDIA RTX 5090" 및 "PyTorch" 이미지를 선택하고 "작업 실행 계속"을 클릭합니다.

4. 리소스 할당이 완료될 때까지 기다립니다. 상태가 "실행 중"으로 변경되면 "워크스페이스 열기"를 클릭하여 Jupyter 워크스페이스에 들어갑니다.
효과 표시
1. 페이지가 리디렉션된 후 왼쪽에 있는 README 파일을 클릭하고 상단의 실행을 클릭합니다.

2. 프로세스가 완료되면 오른쪽에 있는 API 주소를 클릭하여 데모 인터페이스를 엽니다.












