StrataでPCに1250億パラメータAIをローカル実行する
近日、GitHub上でオープンソース推論エンジンStrataが公開された。同プロジェクトは、NVIDIAまたはAMD製12GB以上のVRAMを搭載した一般的なゲーミングPC上で、1250億パラメータの大型AIモデルQwen3.8-Flash-Nextを動作可能にする技術を実現している。StrataはWindowsおよびLinux環境に対応し、ワンクリックインストールスクリプトにより環境構築からモデルダウンロード、ローカルAPIサーバーの起動までを自動化する。実測性能によると、RTX 5070環境では量子化精度により53から94トークン毎秒の推論速度を達成。AMD製RX 9070 XTやRTX 3090ではさらに高速な応答が期待できる。CPUおよびメインメモリーを活用した動的オフロード技術を採用しており、VRAM容量を超えたモデルパラメータを効率的に分散処理することで、専用サーバー不要でエッジ環境での大規模言語モデル運用を可能にした。機能面では、OpenAIおよびAnthropicのAPI仕様に準拠したローカルエンドポイントを提供し、既存のAIコーディングアシスタントやアプリとの連携を容易にする。マルチモーダル画像入力やMCPサーバー経由の自動化制御にも対応する。システム要件はGPU12GB以上、RAM32GB以上、SSD約80GB空き容量を標準とする。プロジェクトはMITライセンスの下で公開され、Qwenチームおよび複数の量子化研究機関の協業によって実現されている。Strataの公開は、個人ユーザーや企業がクラウド依存を回避しつつ、高品質な大型AIモデルをローカル環境で安全に運用する新たな選択肢を示している。プライバシー保護と計算リソースの最適化を両立したこのアプローチは、エッジAI普及の重要な基盤となる可能性がある。
