HyperAIHyperAI

Command Palette

Search for a command to run...

オンラインチュートリアル|4BパラメータによるRAW画像編集の実現:MicrosoftがMage-Flowをオープンソース化し、第2レベルの画像推論を可能にし、最大2048解像度をサポート

Featured Image

画像生成における拡散モデルの継続的な進歩に伴い、DALL·E、Midjourney、FLUXといった製品は、視覚品質の限界を絶えず押し広げています。しかしながら、高品質な生画像は通常、膨大なモデルサイズ(多くの場合20Bまたは30Bパラメータ)を伴い、推論速度の低下とメモリ消費量の増加を招き、個々の開発者がローカル環境で実行する際に大きな課題となっています。

マイクロソフトは最近、この状況を変えるべく、Mage-Flowをオープンソース化した。これは、わずか40億個のパラメータを持つコンパクトな生成モデルです。トークナイザー・バックボーンシステムの協調設計により、画像生成と命令編集の両方のタスクにおいて優れた性能を発揮します。Qwen-Image 20BやFLUX.2 32Bといった大規模モデルと同等、あるいはそれ以上の性能を実現すると同時に、推論速度の向上とVRAM消費量の削減も実現しています。1024×1024ピクセルの画像1枚は、NVIDIA A100 GPUではわずか0.59秒でレンダリングでき、NVIDIA RTX 5090でもスムーズに動作します。

具体的には、Mage-Flowの主要な技術的特長は以下のとおりです。

メイジVAE:軽量で高忠実度の潜在トークナイザーは、FLUX.2-VAEを高品質のアライメントで再構築しますが、エンコードとデコードの計算コストは、それぞれ後者の約1/12と約1/22にすぎません。

NR-MMDiT:ネイティブ解像度マルチモーダル拡散トランスフォーマーは、512から2048までの解像度と任意のアスペクト比(4:1の制限を含む)をサポートします。

システムレベルの最適化:ネイティブ解像度パッケージング、FlashAttention varlen、およびCUDAカーネル統合により、A100上で1024²ピクセルの単一画像に対する推論はわずか0.59秒で完了します。

機能面では、Mage-Flowは中国語と英語のテキストからの画像生成(テキストレンダリングを含む)、指示に基づいた画像編集(外観、内容、シーン、修復)、およびGrado WebUIを介したインタラクティブな作成をサポートしています。

Mage-FlowがHyperAI(hyper.ai)で利用可能になりました。開発者は、より低コストで高品質な画像生成と編集を体験できます。興味のある方は、ワンクリックで簡単に試用できます!

オンラインで実行:https://go.hyper.ai/EJKSG

Mage-Flow デモインターフェース:

テキストから画像への変換効果の図解:

画像編集プレビュー:

オリジナル画像
編集済み

その他のオンラインチュートリアル:

https://hyper.ai/notebooks

デモの実行

1. hyper.ai のホームページにアクセスしたら、「チュートリアル」ページを選択するか、「その他のチュートリアルを表示」をクリックし、「Mage-Flow: 効率的なネイティブ解像度画像の生成と編集のための基本モデル」を選択して、「このチュートリアルを実行」をクリックします。

2. ページがリダイレクトされたら、右上隅の「複製」をクリックして、チュートリアルを独自のコンテナーに複製します。

注:ページの右上で言語を切り替えることができます。現在、中国語と英語が利用可能です。このチュートリアルでは英語で手順を説明します。

3. 「NVIDIA RTX 5090」と「PyTorch」の画像を選択し、「ジョブの実行を続行」をクリックします。

4. リソースが割り当てられるのを待ちます。ステータスが「実行中」に変わったら、「ワークスペースを開く」をクリックしてJupyterワークスペースに入ります。

エフェクト表示

1. ページがリダイレクトされたら、左側のREADMEファイルをクリックし、上部の「実行」をクリックして、すべてのセルを順番に実行します。

2. WebUIを起動する

すべてのセルの処理が完了すると(左側の[*]が数字に変わります)、Grado WebUIが自動的に起動します。右側のパネルにあるAPIアドレスをクリックするとデモページに移動し、テキストから画像への変換や画像編集をオンラインで体験できます。

3. 生成された結果のプレビュー:英語のプロンプトを入力すると、モデルは4ステップの推論で1024×1024の高解像度画像を出力します。参照画像と編集指示をアップロードすると、モデルは指示に従って画像の内容を変更します(背景の置き換え、外観の調整など)。