HyperAIHyperAI

Command Palette

Search for a command to run...

TurboFieldfare实现Gemma 4模型2GB内存本地推理

近日,独立开发者兼Metal工程师Andrey Mikhaylov开源端侧大模型推理项目TurboFieldfare,成功实现260亿参数模型Gemma 4 26B-A4B在仅配备2GB运行内存的Apple Silicon Mac上流畅推理。该项目专为苹果芯片设备打造,突破传统全量加载限制,采用定制Swift与Metal运行时架构。系统仅将1.35GB核心网络与FP16键值缓存驻留内存,其余专家模块则通过SSD按需流式读取,从而将内存占用压缩至约2GB。实测数据显示,该方案在8GB内存的M2 MacBook Air上可达5.1至6.3词每秒的生成速度,而在24GB M5 Pro机型上更是突破每秒31至35词。项目提供原生macOS应用、命令行接口及本地OpenAI兼容服务器,支持指令微调与文本交互,且明确声明为独立研究项目,未获谷歌官方背书。TurboFieldfare通过极致内存优化与底层Metal算力调度,大幅降低端侧大模型运行门槛,为轻薄笔记本部署百亿参数AI模型提供了可行的技术路径,进一步推动本地化人工智能应用的普及与发展。

相关链接