Command Palette
Search for a command to run...
온라인 튜토리얼 | 4B 파라미터를 활용한 원본 이미지 편집 구현: 마이크로소프트, 2차 이미지 추론 및 최대 2048 해상도 지원 기능을 갖춘 Mage-Flow 오픈소스 공개

확산 모델이 이미지 생성 분야에서 지속적으로 혁신을 이루면서 DALL·E, Midjourney, FLUX와 같은 제품들은 시각적 품질의 한계를 끊임없이 뛰어넘고 있습니다. 그러나 고품질 원본 이미지는 대개 20B 또는 30B에 달하는 방대한 파라미터를 포함하는 거대한 모델 크기를 수반하며, 이는 추론 속도 저하와 높은 메모리 사용량으로 이어져 개별 개발자가 로컬 환경에서 실행하기에는 상당한 어려움을 야기합니다.
마이크로소프트는 이러한 상황을 바꾸기 위해 최근 Mage-Flow를 오픈소스로 공개했습니다.이 모델은 40억 개의 파라미터만으로 구성된 소형 생성 모델입니다. 토크나이저-백본-시스템의 협업 설계를 통해 이미지 생성과 명령어 편집 작업 모두에서 뛰어난 성능을 발휘합니다.**이 모델은 Qwen-Image 20B 및 FLUX.2 32B와 같은 대형 모델과 동등하거나 그 이상의 성능을 달성하는 동시에 더 빠른 추론 속도와 더 낮은 VRAM 사용량을 제공합니다.**NVIDIA A100 GPU에서는 1024×1024 크기의 이미지 하나를 단 0.59초 만에 렌더링할 수 있으며, NVIDIA RTX 5090에서도 원활하게 실행됩니다.
구체적으로, Mage-Flow의 핵심 기술적 특징은 다음과 같습니다.
마법사-VAE:경량화되고 정확도가 높은 잠재 토크나이저는 높은 정렬 품질을 유지하면서 FLUX.2-VAE를 재구성하지만, 인코딩 및 디코딩 계산 비용은 기존 방식의 약 1/12 및 1/22에 불과합니다.
NR-MMDiT:네이티브 해상도 멀티모달 확산 변환기는 512에서 2048까지의 해상도와 임의의 화면비(4:1 제한 포함)를 지원합니다.
시스템 수준 최적화:네이티브 해상도 패키징, FlashAttention varlen 및 CUDA 커널 통합을 통해 A100에서 단일 1024² 이미지에 대한 추론은 단 0.59초 만에 완료됩니다.
기능적으로 Mage-Flow는 중국어 및 영어 텍스트에서 이미지를 생성하는 기능(텍스트 렌더링 포함), 명령 기반 이미지 편집(외관, 내용, 장면 및 복구), Grado WebUI를 통한 대화형 이미지 생성을 지원합니다.
Mage-Flow가 이제 HyperAI(hyper.ai)에서 제공됩니다. 개발자는 이를 통해 더 낮은 비용으로 고품질 이미지 생성 및 편집을 경험할 수 있습니다. 관심 있는 사용자는 클릭 한 번으로 Mage-Flow를 자세히 살펴볼 수 있습니다!
온라인으로 실행:https://go.hyper.ai/EJKSG
Mage-Flow 데모 인터페이스:
텍스트를 이미지로 변환하는 효과 다이어그램:
이미지 편집 미리보기:


데모 실행
1. hyper.ai 홈페이지에 접속한 후 "튜토리얼" 페이지를 선택하거나 "더 많은 튜토리얼 보기"를 클릭하고 "Mage-Flow: 효율적인 원본 해상도 이미지 생성 및 편집을 위한 기본 모델"을 선택한 다음 "이 튜토리얼 실행"을 클릭합니다.


2. 페이지가 리디렉션된 후 오른쪽 상단의 "복제"를 클릭하여 튜토리얼을 자신의 컨테이너로 복제합니다.
참고: 페이지 오른쪽 상단에서 언어를 변경할 수 있습니다. 현재 중국어와 영어로만 제공됩니다. 이 튜토리얼에서는 영어로 된 단계를 안내합니다.
3. "NVIDIA RTX 5090" 및 "PyTorch" 이미지를 선택하고 "작업 실행 계속"을 클릭합니다.

4. 리소스 할당이 완료될 때까지 기다립니다. 상태가 "실행 중"으로 변경되면 "워크스페이스 열기"를 클릭하여 Jupyter 워크스페이스에 들어갑니다.
효과 표시
1. 페이지 리디렉션 후 왼쪽의 README 파일을 클릭하고 상단의 실행 버튼을 클릭하여 모든 셀을 순서대로 실행하세요.

2. 웹UI 실행
모든 셀의 실행이 완료되면(왼쪽의 [*] 표시가 숫자로 바뀜), Grado 웹 UI가 자동으로 실행됩니다. 오른쪽 패널의 API 주소를 클릭하면 데모 페이지로 이동하여 텍스트를 이미지로 변환하거나 이미지를 온라인으로 편집하는 기능을 체험할 수 있습니다.
3. 생성된 결과 미리보기:영문 프롬프트를 입력하면 모델이 4단계 추론 과정을 거쳐 1024×1024 고해상도 이미지를 출력합니다. 참조 이미지와 편집 지침을 업로드하면 모델이 지침에 따라 이미지 내용을 수정합니다(배경 교체, 외관 조정 등).












