HyperAIHyperAI

Command Palette

Search for a command to run...

Online-Tutorial | RAW-Bildbearbeitung Mit 4-Bit-Parametern: Microsoft Stellt Mage-Flow Als Open Source Bereit Und Ermöglicht Bildinferenz Zweiter Ebene Sowie Die Unterstützung Von Auflösungen Bis Zu 2048 Pixeln.

Featured Image

Dank der kontinuierlichen Fortschritte bei Diffusionsmodellen zur Bildgenerierung verschieben Produkte wie DALL·E, Midjourney und FLUX stetig die Grenzen der visuellen Qualität. Hochwertige Rohbilder gehen jedoch üblicherweise mit enorm großen Modellen einher – oft mit 20 oder 30 Milliarden Parametern. Dies führt zu langsamen Inferenzgeschwindigkeiten und hohem Speicherverbrauch und stellt eine erhebliche Herausforderung für einzelne Entwickler dar, die die Modelle lokal ausführen möchten.

Microsoft hat kürzlich Mage-Flow als Open Source veröffentlicht, um diese Situation zu ändern.Es handelt sich um ein kompaktes generatives Modell mit nur 4 Milliarden Parametern. Dank der kollaborativen Entwicklung des Tokenizer-Backbone-Systems eignet es sich hervorragend sowohl für die Bildgenerierung als auch für die Bearbeitung von Anweisungen.Es erzielt eine Leistung, die mit der von großen Modellen wie Qwen-Image 20B und FLUX.2 32B vergleichbar ist oder diese sogar übertrifft, und bietet gleichzeitig eine schnellere Inferenz und einen geringeren VRAM-Verbrauch.Ein einzelnes 1024×1024-Bild kann auf einer NVIDIA A100 GPU in nur 0,59 Sekunden gerendert werden und läuft auch auf einer NVIDIA RTX 5090 flüssig.

Zu den wichtigsten technologischen Highlights von Mage-Flow gehören insbesondere:

Mage-VAE:Ein leichtgewichtiger, hochpräziser latenter Tokenizer rekonstruiert FLUX.2-VAE mit hoher Ausrichtungsqualität, wobei die Berechnungskosten für die Kodierung und Dekodierung jedoch nur etwa 1/12 bzw. 1/22 der letztgenannten betragen.

NR-MMDiT:Der Multimodal Diffusion Transformer mit nativer Auflösung unterstützt Auflösungen von 512 bis 2048 und beliebige Seitenverhältnisse (einschließlich der Grenze von 4:1).

Systemoptimierung:Dank nativer Auflösungspaketierung, FlashAttention varlen und CUDA-Kernelintegration dauert die Inferenz eines einzelnen 1024²-Bildes auf einem A100 nur 0,59 Sekunden.

Funktional unterstützt Mage-Flow die Generierung von Bildern aus chinesischem und englischem Text (einschließlich Textwiedergabe), die anweisungsbasierte Bildbearbeitung (Erscheinungsbild, Inhalt, Szene und Reparatur) sowie die interaktive Erstellung über Grado WebUI.

Mage-Flow ist jetzt auf HyperAI (hyper.ai) verfügbar und ermöglicht Entwicklern die kostengünstige Erstellung und Bearbeitung hochwertiger Bilder. Interessierte können es mit einem Klick ausprobieren!

Online ausführen:https://go.hyper.ai/EJKSG

Mage-Flow Demo-Oberfläche:

Diagramm zum Text-zu-Bild-Effekt:

Bildbearbeitungsvorschau:

Originalbild
Bearbeitet

Weitere Online-Tutorials:

https://hyper.ai/notebooks

Demolauf

1. Nachdem Sie die Hyper.ai-Homepage aufgerufen haben, wählen Sie die Seite „Tutorials“ aus oder klicken Sie auf „Weitere Tutorials anzeigen“, wählen Sie „Mage-Flow: Ein Basismodell für die effiziente Generierung und Bearbeitung von Bildern in nativer Auflösung“ aus und klicken Sie auf „Dieses Tutorial ausführen“.

2. Nachdem die Seite weitergeleitet wurde, klicken Sie oben rechts auf „Klonen“, um das Tutorial in Ihren eigenen Container zu klonen.

Hinweis: Sie können die Sprache oben rechts auf der Seite ändern. Derzeit sind Chinesisch und Englisch verfügbar. Dieses Tutorial zeigt die Schritte auf Englisch.

3. Wählen Sie die Images „NVIDIA RTX 5090“ und „PyTorch“ aus und klicken Sie auf „Auftragsausführung fortsetzen“.

4. Warten Sie, bis die Ressourcen zugewiesen wurden. Sobald sich der Status auf „Wird ausgeführt“ ändert, klicken Sie auf „Arbeitsbereich öffnen“, um den Jupyter-Arbeitsbereich zu betreten.

Effektanzeige

1. Nachdem die Seite weitergeleitet wurde, klicken Sie auf die README-Datei auf der linken Seite und anschließend oben auf Ausführen, um alle Zellen nacheinander auszuführen.

2. WebUI starten

Sobald alle Zellen ihre Arbeit abgeschlossen haben (das [*] links ändert sich in eine Zahl), startet die Grado-Weboberfläche automatisch. Klicken Sie im rechten Bereich auf die API-Adresse, um zur Demoseite zu gelangen und die Text-zu-Bild- und Bildbearbeitung online auszuprobieren.

3. Vorschau des generierten Ergebnisses:Geben Sie eine beliebige englische Eingabeaufforderung ein, und das Modell gibt in vier Inferenzschritten ein hochauflösendes Bild der Größe 1024×1024 aus; laden Sie ein Referenzbild und Bearbeitungsanweisungen hoch, und das Modell ändert den Bildinhalt entsprechend den Anweisungen (z. B. durch Ersetzen des Hintergrunds, Anpassen des Erscheinungsbilds usw.).