HyperAIHyperAI

Command Palette

Search for a command to run...

在线教程|4B 参数实现生图+编辑,微软开源 Mage-Flow,秒级图像推理至高支持 2048 分辨率

Featured Image

随着扩散模型(Diffusion Model)在图像生成领域的持续突破,DALL·E 、 Midjourney 、 FLUX 等产品不断刷新视觉质量上限。但高质量生图通常伴随巨大的模型体量——动辄 20B 、 30B 参数,推理速度慢、显存占用高,个人开发者在本地运行面临不小门槛。

微软近日开源的 Mage-Flow 试图打破这一局面。这是一款仅 4B 参数的紧凑型生成模型,通过 Tokenizer-Backbone-System 三位一体的协同设计,在图像生成与指令编辑两大任务上,做到了媲美甚至超越 Qwen-Image 20B 、 FLUX.2 32B 等大模型的效果,同时推理更快、显存更省。单张 NVIDIA A100 GPU 上 1024×1024 出图只需 0.59 秒,NVIDIA RTX 5090 也能流畅跑。

具体来看,Mage-Flow 的核心技术亮点包括:

Mage-VAE:轻量级高保真潜在分词器(Latent Tokenizer),重建质量对齐 FLUX.2-VAE,但编解码计算量分别仅为后者的 ~1/12 和 ~1/22 。

NR-MMDiT:原生分辨率多模态扩散 Transformer(Native-Resolution Multimodal Diffusion Transformer),支持 512 到 2048 分辨率及任意宽高比(含极限 4:1)。

系统级优化:原生分辨率打包 + FlashAttention varlen + 融合 CUDA 内核,单张 A100 上 1024² 图像推理仅需 0.59 秒。

功能上,Mage-Flow 支持中英文文本生成图像(含文字渲染)、指令式图像编辑(外观、内容、场景、修复),以及 Gradio WebUI 交互式创作。

Mage-Flow 已在 HyperAI(hyper.ai)上线,帮助开发者以更低成本体验高质量图像生成与编辑,感兴趣的小伙伴快来一键探索吧!

在线运行:https://go.hyper.ai/EJKSG

Mage-Flow Demo 界面:

Text to Image 效果图:

Image Edit 效果图:

原图
编辑后

更多在线教程:

https://hyper.ai/notebooks

Demo 运行

1 、进入 hyper.ai 首页后,选择「教程」页面,或点击「查看更多教程」,选择「Mage-Flow: 高效原生分辨率图像生成与编辑基础模型」,点击「运行此教程」。

2. 页面跳转后,点击右上角「Clone」,将该教程克隆至自己的容器中。

注:页面右上角支持切换语言,目前提供中文及英文两种语言,本教程文章以英文为例进行步骤展示。

3. 选择「NVIDIA RTX 5090」以及「PyTorch」镜像,点击「Continue job execution(继续执行)」。

4. 等待分配资源,当状态变为「Running(运行中)」后,点击「Open Workspace」进入 Jupyter Workspace 。

效果展示

1. 页面跳转后,点击左侧 README 文件,进入后点击上方 Run(运行),依次执行所有 Cell 。

2. 启动 WebUI

待所有 Cell 运行完成(左侧 [*] 变为数字编号),Gradio WebUI 将自动启动。点击右侧面板的 API 地址,即可跳转至 Demo 页面,在线体验文生图与图像编辑。

3. 生成效果预览:输入任意英文 Prompt,4 步推理即可输出 1024×1024 高清图像;上传参考图 + 编辑指令,模型将按指令修改图像内容(如替换背景、调整外观等)