Command Palette
Search for a command to run...
在线教程|27B 大模型压缩到 7.2GB!Ternary-Bonsai 用「三进制魔法」让大模型跑进个人电脑

随着大语言模型(LLM)的能力不断发展,模型规模也在持续膨胀,千亿参数级别已成常态。但更强的能力往往意味着更高的部署门槛:数十 GB 的显存占用和计算资源需求,让大多数开发者只能在云端望而却步。
Prism ML 团队推出了 Ternary-Bonsai-27B——一个以高效推理为核心的 27B 级大型语言模型,正是瞄准这个痛点。该模型基于 Qwen3.6-27B 架构,通过端到端三进制量化技术,将模型权重压缩为 {-1 、 0 、+1} 三种状态,并结合 FP16 批量缩放机制,在大幅降低模型体积的同时尽可能保留原始模型能力。
压缩效果相当直接:原本约 54GB 的 27B 模型被压缩至 7.2GB,体积缩小约 9.4 倍,同时保留约 95% 的 FP16 性能。过去需要高性能服务器才能跑的大模型,现在单 GPU 甚至笔记本就能部署。
除了模型压缩,Ternary-Bonsai-27B 还针对长上下文和推理效率进行了优化。模型采用混合注意力架构,将约 75% 的计算交给更高效的线性注意力完成,同时保留部分全注意力机制处理复杂语义,支持最长 262K tokens 上下文。处理 100K tokens 长文本时,峰值内存仅约 14.7GB 。配套的 DSpark 解码引擎将生成速度提升约 1.34 倍,兼容 CUDA 、 Metal 和 CPU 等多种运行环境。
Ternary-Bonsai-27B 已在 HyperAI(hyper.ai)上线,支持一键部署和快速调用,帮助开发者降低大模型使用门槛,快速上手 AI 应用开发。⬇️
在线运行:https://go.hyper.ai/V4fXi

更多在线教程:
Demo 运行
1 、进入 hyper.ai 首页后,选择「教程」页面,或点击「查看更多教程」,选择「Ternary-Bonsai-27B:7.2GB 三值量化推理 27B」,点击「运行此教程」。



2. 页面跳转后,点击右上角「Clone」,将该教程克隆至自己的容器中。
注:页面右上角支持切换语言,目前提供中文及英文两种语言,本教程文章以英文为例进行步骤展示。

3. 选择「NVIDIA RTX 5090」以及「PyTorch」镜像,点击「Continue job execution(继续执行)」。


4. 等待分配资源,当状态变为「Running(运行中)」后,点击「Open Workspace」进入 Jupyter Workspace 。

效果展示
1. 页面跳转后,点击左侧 README 文件,进入后点击上方 Run(运行)。


2. 待运行完毕后,点击右侧 API 地址即可打开 Demo 界面。









