HyperAIHyperAI

Command Palette

Search for a command to run...

دورة تعليمية عبر الإنترنت | تحرير الصور الخام باستخدام معلمات 4 بايت: برنامج Mage-Flow مفتوح المصدر من مايكروسوفت، والذي يُمكّن من استنتاج الصور من المستوى الثاني ويدعم دقة تصل إلى 2048

Featured Image

مع التطورات المتواصلة في نماذج الانتشار لتوليد الصور، تسعى منتجات مثل DALL·E وMidjourney وFLUX باستمرار إلى رفع مستوى جودة الصورة. إلا أن الصور الخام عالية الجودة عادةً ما تكون مصحوبة بأحجام نماذج ضخمة - تصل في كثير من الأحيان إلى 20 أو 30 مليار مُعامل - مما يؤدي إلى بطء سرعة الاستدلال واستهلاك عالٍ للذاكرة، الأمر الذي يُشكل تحديًا كبيرًا للمطورين لتشغيلها محليًا.

قامت مايكروسوفت مؤخراً بجعل Mage-Flow مفتوح المصدر في محاولة لتغيير هذا الوضع.هذا نموذج توليدي مضغوط يحتوي على 4 مليارات مُعامل فقط. وبفضل التصميم التعاوني لنظام Tokenizer-Backbone-System، يتفوق هذا النموذج في كلٍ من مهام توليد الصور وتحرير التعليمات.يحقق أداءً مماثلاً أو حتى يتجاوز أداء النماذج الكبيرة مثل Qwen-Image 20B و FLUX.2 32B، مع توفير استدلال أسرع واستهلاك أقل لذاكرة الوصول العشوائي للفيديو.يمكن عرض صورة واحدة بحجم 1024×1024 في 0.59 ثانية فقط على وحدة معالجة الرسومات NVIDIA A100، ويمكن تشغيلها بسلاسة أيضًا على NVIDIA RTX 5090.

وعلى وجه التحديد، تشمل أبرز الميزات التقنية الأساسية لـ Mage-Flow ما يلي:

ماج-فاي:يقوم محلل الكلمات الكامنة خفيف الوزن وعالي الدقة بإعادة بناء FLUX.2-VAE بمحاذاة عالية الجودة، ولكن تكاليف حساب التشفير وفك التشفير هي ~1/12 و~1/22 من الأخيرة، على التوالي.

NR-MMDiT:يدعم محول الانتشار متعدد الوسائط ذو الدقة الأصلية دقة تتراوح من 512 إلى 2048 وأي نسبة عرض إلى ارتفاع (بما في ذلك الحد الأقصى 4:1).

تحسين النظام على مستوى النظام:بفضل تقنية التغليف بدقة أصلية، وFlashAttention varlen، وتكامل نواة CUDA، فإن الاستدلال على صورة واحدة بحجم 1024² على A100 يستغرق 0.59 ثانية فقط.

من الناحية الوظيفية، يدعم Mage-Flow إنشاء الصور من النصوص الصينية والإنجليزية (بما في ذلك عرض النصوص)، وتحرير الصور القائم على التعليمات (المظهر والمحتوى والمشهد والإصلاح)، والإنشاء التفاعلي عبر Grado WebUI.

أصبح برنامج Mage-Flow متاحًا الآن على منصة HyperAI (hyper.ai)، مما يُمكّن المطورين من تجربة إنشاء الصور وتحريرها بجودة عالية وبتكلفة أقل. يمكن للمستخدمين المهتمين استكشافه بنقرة واحدة!

تشغيل عبر الإنترنت:https://go.hyper.ai/EJKSG

واجهة عرض Mage-Flow التجريبية:

مخطط تأثير تحويل النص إلى صورة:

معاينة تعديل الصورة:

الصورة الأصلية
تم التعديل

المزيد من الدروس التعليمية عبر الإنترنت:

https://hyper.ai/notebooks

تشغيل تجريبي

1. بعد الدخول إلى الصفحة الرئيسية لموقع hyper.ai، حدد صفحة "الدروس التعليمية"، أو انقر فوق "عرض المزيد من الدروس التعليمية"، وحدد "Mage-Flow: نموذج أساسي لإنشاء وتحرير الصور بدقة أصلية فعالة"، ثم انقر فوق "تشغيل هذا البرنامج التعليمي".

2. بعد إعادة توجيه الصفحة، انقر فوق "استنساخ" في الزاوية اليمنى العليا لاستنساخ البرنامج التعليمي في الحاوية الخاصة بك.

ملاحظة: يمكنك تبديل اللغات في الزاوية العلوية اليمنى من الصفحة. حاليًا، اللغتان الصينية والإنجليزية متاحتان. سيوضح هذا البرنامج التعليمي الخطوات باللغة الإنجليزية.

3. حدد صور "NVIDIA RTX 5090" و "PyTorch"، وانقر فوق "متابعة تنفيذ المهمة".

4. انتظر حتى يتم تخصيص الموارد. بمجرد أن تتغير الحالة إلى "قيد التشغيل"، انقر فوق "فتح مساحة العمل" للدخول إلى مساحة عمل Jupyter.

عرض التأثير

1. بعد إعادة توجيه الصفحة، انقر فوق ملف README الموجود على اليسار، ثم انقر فوق تشغيل في الأعلى لتنفيذ جميع الخلايا بالتسلسل.

2. تشغيل واجهة المستخدم الرسومية

بمجرد انتهاء تشغيل جميع الخلايا (سيتحول الرمز [*] الموجود على اليسار إلى رقم)، سيتم تشغيل واجهة مستخدم Grado WebUI تلقائيًا. انقر على عنوان API في اللوحة اليمنى للانتقال إلى صفحة العرض التوضيحي وتجربة تحويل النص إلى صورة وتحرير الصور عبر الإنترنت.

3. معاينة للنتيجة المُولّدة:أدخل أي موجه باللغة الإنجليزية، وسيقوم النموذج بإخراج صورة عالية الدقة 1024×1024 في 4 خطوات من الاستدلال؛ قم بتحميل صورة مرجعية وتعليمات التحرير، وسيقوم النموذج بتعديل محتوى الصورة وفقًا للتعليمات (مثل استبدال الخلفية، وتعديل المظهر، وما إلى ذلك).