HyperAIHyperAI

Command Palette

Search for a command to run...

TurboFieldfare、2GB RAMでGemma 4推論を可能に

独立系機械学習エンジニアのAndrey Mikhaylov氏が開発したTurboFieldfareが、Apple Silicon搭載Macにおいてわずか約2GBのメモリで260億パラメータのGemma 4 A4Bモデルを実行可能にするランタイムとして公開された。本プロジェクトは、従来の全パラメータ転送方式を放棄し、1.35GBの共有コアとFP16 KVキャッシュをメモリに保持したまま、トークン生成ごとにSSDから必要なMoEエキスパートをストリーミングで読み出す独自アーキテクチャを採用している。 基盤技術はSwiftとMetalをフル活用してゼロから構築されており、既存フレームワークをラップしたものではなく、4bit量子化された重みと8bitルーター、専用Metalカーネルによる高度な最適化が施されている。これにより、8GB RAM搭載のM2 MacBook Airでは5.1から6.3 tok/s、24GB搭載のM5 Proでは31から35 tok/sの推論速度を実現。インストール済みモデルサイズは約14.3GBで、Hugging Faceから制限付き範囲リクエストを用いてストリーミングリパックする独自インストーラーが提供されている。 機能面では、ネイティブMacアプリ、CLI、OpenAI互換ループバックサーバー、およびSwiftパッケージライブラリを統一的に提供。テキスト生成のみに特化し、チャット形式のフォーマット自動処理や温度やTop-KやTop-Pなどのサンプリングパラメータ調整に対応する。APIサーバーは関数呼び出しの宣言を受け付けるが、実行権限はクライアント側に委ねられている。 システム設計では、プロンプトプレフィルを128トークン単位で分割し、SSDベースのエキスパートキャッシュとLFU管理によるミスマッチ最適化、そして共有と経路指定ルーターの並列演算をMetal上で実行している。KVキャッシュはスライディングウィンドウ層とフル注意層で階層的に配置され、正確なSplit-K/Vデコード注意機構が実装されている。 本プロジェクトはApache 2.0ライセンスで公開され、モデル重みは別途Hugging Faceから取得する必要がある。公式にはGoogleやAlphabetとの関係はない独立研究プロジェクトとして位置づけられており、オンデバイスAIとMetalエンジニアリングの知見を結集した本格的な実装として評価できる。メモリ制約が厳しい環境での大規模言語モデル実運用に向けた新しい最適化パラダイムを示す技術として、開発者コミュニティから注目されている。

関連リンク