Mage-Flow 是微软推出的一款高效的原生分辨率(Native-Resolution)图像生成与编辑基础模型(相关论文为 arXiv:2607.19064)。该项目旨在以较低的计算成本和内存占用,提供媲美甚至超越更大规模开源系统(如 Qwen-Image 20B、FLUX.2 32B 等)的最先进图像生成与编辑性能。
核心特点与架构优势
- 紧凑的 4B 参数规模:模型采用 40 亿参数的生成式堆栈,通过精心的组件协同设计,保持了极快的速度、较低的内存占用,并在实际计算预算下非常容易进行微调。
- Mage-VAE(高效标记器):
- 一个轻量级、高保真度的潜在分词器。
- 采用对称的一步式像素扩散编解码器架构,匹配了 FLUX.2-VAE 的重建保真度,同时每个像素的 MACs(乘加运算次数)减少了约 12× 到 22×,消除了高分辨率下的瓶颈。
- NR-MMDiT(核心骨干网络):
- 一个共享的 4B 原生分辨率多模态扩散变换器(Multimodal DiT),在 Mage-VAE 的潜在空间中使用修正流匹配(Flow Matching)进行训练。
- 原生分辨率支持:
- 单个检查点即可生成从 512512 到 20482048 像素、任意宽高比(包括极端比例如 4:14:1)的图像,无需进行传统的分桶量化(bucket quantization)和填充(padding)。
- 系统级加速:
- 通过原生分辨率打包(FlashAttention 可变长度 + 每个样本的 2D 旋转位置编码)和融合的 CUDA 内核,大幅提升了模型训练和推理效率,并将无分类器引导(CFG)的条件与非条件分支融合成单个前向传递。
模型系列(Model Zoo)
该项目基于统一的技术栈衍生出了两大主要应用分支,每个分支均提供三种变体:
- Mage-Flow(文本转图像):
- Base 版:基础模型(30 步)。
- RL-aligned 版:强化学习对齐版(20 步),提升了提示词遵循能力、美学效果和文本渲染能力。
- Turbo 版:4 步少步蒸馏版。
- Mage-Flow-Edit(图像编辑):
- 支持语义内容编辑、外观转换、图像恢复和结构感知输出,同样分为 Base 版(30 步)、RL-aligned 版(30 步)和 Turbo 版(4 步)。
主要功能与支持任务
- 文本到图像(Text-to-Image):具备优秀的提示词遵循能力、精细的细节表现,并支持清晰的英文和中文字符渲染。
- 基于指令的图像编辑(Instruction-based Editing):支持外观修改、局部内容与对象编辑、场景与相机转换、艺术化渲染以及低阶视觉与恢复任务。支持单图参考编辑以及多图融合编辑(如将图 2 的对象融合到图 1 中)。
项目地址:https://huggingface.co/microsoft/Mage-Flow
https://huggingface.co/microsoft/Mage-Flow
主题授权提示:请在后台主题设置-主题授权-激活主题的正版授权,授权购买:RiTheme官网
声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。

评论(0)