Command Palette
Search for a command to run...
Tutoriel En Ligne | Retouche d'images RAW Avec 4 Milliards De Paramètres : Microsoft Ouvre Le Code Source De MageFlow, Permettant l'inférence d'images De Second Niveau Et Prenant En Charge Une Résolution jusqu'à 2048 pixels.

Grâce aux progrès constants des modèles de diffusion en génération d'images, des produits comme DALL·E, Midjourney et FLUX repoussent sans cesse les limites de la qualité visuelle. Cependant, les images brutes de haute qualité s'accompagnent généralement de modèles très volumineux (souvent 20 ou 30 milliards de paramètres), ce qui ralentit l'inférence et consomme beaucoup de mémoire, constituant ainsi un défi majeur pour les développeurs souhaitant les exécuter en local.
Microsoft a récemment rendu Mage-Flow open source dans le but de changer cette situation.Il s'agit d'un modèle génératif compact ne comportant que 4 milliards de paramètres. Grâce à la conception collaborative du système de tokenisation et de l'architecture de base, il excelle à la fois dans la génération d'images et dans les tâches d'édition d'instructions.Il atteint des performances comparables, voire supérieures, à celles de grands modèles tels que Qwen-Image 20B et FLUX.2 32B, tout en offrant une inférence plus rapide et une consommation de VRAM plus faible.Une seule image de 1024×1024 pixels peut être rendue en seulement 0,59 seconde sur un GPU NVIDIA A100, et elle peut également fonctionner de manière fluide sur un NVIDIA RTX 5090.
Plus précisément, les principaux atouts technologiques de Mage-Flow sont les suivants :
Mage-VAE :Un tokenizer latent léger et de haute fidélité reconstruit FLUX.2-VAE avec un alignement de haute qualité, mais les coûts de calcul d'encodage et de décodage ne sont que d'environ 1/12 et 1/22 de ce dernier, respectivement.
NR-MMDiT :Le transformateur de diffusion multimodal à résolution native prend en charge les résolutions de 512 à 2048 et tous les rapports d'aspect (y compris la limite de 4:1).
Optimisation au niveau du système :Avec l'encapsulation en résolution native, FlashAttention varlen et l'intégration du noyau CUDA, l'inférence sur une seule image 1024² sur un A100 ne prend que 0,59 seconde.
Sur le plan fonctionnel, Mage-Flow prend en charge la génération d'images à partir de textes chinois et anglais (y compris le rendu de texte), l'édition d'images basée sur des instructions (apparence, contenu, scène et réparation) et la création interactive via l'interface Web de Grado.
Mage-Flow est désormais disponible sur HyperAI (hyper.ai), permettant aux développeurs de bénéficier d'une génération et d'une édition d'images de haute qualité à moindre coût. Les utilisateurs intéressés peuvent l'explorer en un seul clic !
Exécutez en ligne :https://go.hyper.ai/EJKSG
Interface de démonstration de Mage-Flow :

Diagramme de conversion texte-image :

Aperçu de la modification de l'image :


Plus de tutoriels en ligne :
Essai de démonstration
1. Après avoir accédé à la page d'accueil d'hyper.ai, sélectionnez la page « Tutoriels » ou cliquez sur « Voir plus de tutoriels », sélectionnez « Mage-Flow : un modèle de base pour la génération et l'édition efficaces d'images en résolution native », puis cliquez sur « Exécuter ce tutoriel ».



2. Une fois la page redirigée, cliquez sur « Cloner » en haut à droite pour cloner le tutoriel dans votre propre conteneur.
Remarque : Vous pouvez changer de langue en haut à droite de la page. Actuellement, le chinois et l’anglais sont disponibles. Ce tutoriel présente les étapes en anglais.

3. Sélectionnez les images « NVIDIA RTX 5090 » et « PyTorch », puis cliquez sur « Continuer l'exécution de la tâche ».


4. Attendez que les ressources soient allouées. Une fois que le statut passe à « En cours d'exécution », cliquez sur « Ouvrir l'espace de travail » pour accéder à l'espace de travail Jupyter.

Affichage des effets
1. Une fois la page redirigée, cliquez sur le fichier README à gauche, puis sur Exécuter en haut pour exécuter toutes les cellules en séquence.


2. Lancer l'interface Web
Une fois que toutes les cellules auront terminé leur traitement (l'astérisque [*] à gauche se transformera en nombre), l'interface web de Grado s'ouvrira automatiquement. Cliquez sur l'adresse de l'API dans le panneau de droite pour accéder à la page de démonstration et découvrir les fonctionnalités de conversion de texte en image et d'édition d'images en ligne.

3. Aperçu du résultat généré :Saisissez n'importe quelle invite en anglais, et le modèle générera une image haute résolution de 1024×1024 en 4 étapes d'inférence ; téléchargez une image de référence et des instructions de modification, et le modèle modifiera le contenu de l'image en fonction des instructions (par exemple, en remplaçant l'arrière-plan, en ajustant l'apparence, etc.).









