Microsoft Asia 於 7 月 22 日在 Hugging Face 公開發布了 Mage-Flow 圖像模型,一個僅 40 億參數的圖像生成與編輯模型。這個模型在 1024×1024 解析度下僅需 4 步推理就能在 1 秒內生成一張圖片,且支援原生解析度從 512 到 2048 的任意長寬比。更引人注目的是,它在多項基準測試中追平甚至超越了 FLUX.2(32B)、Qwen-Image(20B)等參數量高出 5 到 8 倍的模型。

論文同日上線 arXiv(編號 2607.19064),GitHub 專案 microsoft/Mage 以 MIT 授權開源,Hugging Face Spaces 上也提供了即時試用介面。從發布不到 24 小時,已有開發者成功在 AMD Strix Halo 等消費級硬體上跑起來,ComfyUI 整合也在進行中。
4B 參數做到什麼程度
Mage-Flow 的核心架構由兩個共同設計的元件組成:Mage-VAE 和 NR-MMDiT。Mage-VAE 是一個輕量級高保真潛在 tokenizer,採用單步擴散式編解碼,搭配錨點潛在 KL 正則化。它在重建品質上匹配 FLUX.2-VAE,但每像素的編碼與解碼運算量分別降低了約 12 倍與 22 倍,直接消除了 VAE 在高解析度場景的瓶頸。
NR-MMDiT 則是一個 4B 參數的原生解析度多模態擴散 Transformer,使用 Qwen3-VL 作為文字編碼器,透過矯正流匹配(rectified flow matching)在 Mage-VAE 的潛在空間中訓練。原生解析度打包(native-resolution packing)消除了傳統的 bucket 量化與 padding,讓同一組模型權重能生成 512×2048、2048×512 等極端長寬比的圖片。配合 FlashAttention var-len 序列打包與 per-sample 2D RoPE,CFG 的條件分支與無條件分支能在一次前向傳播中合併執行。
系統層面的 CUDA 核融合將每步訓練時間從約 1.93 秒壓縮到約 0.78 秒,整體訓練吞吐量提升約 2.5 倍。在單張 A100 GPU 上,Mage-Flow-Turbo 生成一張 1024×1024 圖片只需 0.59 秒,Mage-Flow-Edit-Turbo 編輯一張圖片只需 1.02 秒,峰值記憶體約 18 到 20 GB,在所有對比系統中最低。作為對比,FLUX.2-dev(32B)在同樣解析度下的記憶體需求遠高於此,而 FLUX.2-Klein-4B 雖然也是 4B 參數量,但在 GenEval 基準上的 0.83 分低於 Mage-Flow-Turbo 的 0.88 分。
基準測試:小模型的大成績
在文字轉圖片的基準測試中,Mage-Flow RL-aligned 版本在 GenEval 拿到 0.90 分,超越 FLUX.2-dev(0.87)、Qwen-Image(0.87)以及 ByteDance 的 LongCat-Image(0.87)。Turbo 版本在僅 4 步推理下仍達到 0.88 分。在 DPG-Bench 上,Mage-Flow 取得 86.49 分,與 Qwen-Image 的 88.32 分差距不大,但參數量只有後者的五分之一。
圖片編輯方面,Mage-Flow-Edit-Turbo 在 ImgEdit-Bench 拿到 4.38 分,超越 FLUX.2-dev(4.35)和 FLUX.2-Klein-9B(4.18)。在 GEdit-Bench 英文與中文評測中分別取得 8.271 和 8.264 分,與 JoyAI-Image-Edit(16B)的 8.276 和 8.125 分幾乎持平。在 TextEdit-Bench 合成測試中拿到 12.77 分,超過 FLUX.2-dev 的 11.86 分。唯一明顯落後的是 FireRed-Image-Edit(20B)的 15.19 分,但後者參數量是 Mage-Flow 的 5 倍。
與閉源模型相比,Mage-Flow 的 GenEval 0.90 分也追上了 Seedream 4.0(0.84)和 Nano-Banana-Pro(0.83)等商業模型。在開源模型中,Mage-Flow 是在 4B 參數量級達到這個分數的首個模型。
完整模型家族與授權
Mage-Flow 是一個完整家族。文字轉圖片有 Base(30 步)、RL-aligned(20 步)、Turbo(4 步蒸餾)三種版本;圖片編輯同樣有 Base、RL-aligned、Turbo 三種版本。RL-aligned 版本透過 Diffusion-NFT 強化提示遵循、文字渲染、美學品質與編輯保真度;Turbo 版本則透過解耦 DMD 加對抗感知引導的少步蒸餾技術,在 4 步內完成生成或編輯。
所有六個模型 checkpoint 均以 MIT 授權在 Hugging Face 上發布,包括 microsoft/Mage-Flow-Base、microsoft/Mage-Flow、microsoft/Mage-Flow-Turbo,以及對應的 Edit 版本。GitHub 專案 microsoft/Mage 提供完整的 Python API、CLI 工具和 Gradio Web UI,使用者可以用 mage-flow、mage-flow-edit、mage-flow-app 三個指令快速啟動。Diffusers 函式庫也已支援,幾行程式碼即可呼叫:安裝 diffusers 後透過 DiffusionPipeline.from_pretrained("microsoft/Mage-Flow-Turbo") 載入模型,傳入提示詞即可生成。CLI 還支援批次生成,多個提示詞可在一次前向傳播中打包執行,每個樣本可以設定不同的解析度與種子。
| Model | Task | Variant | Steps | Hugging Face |
|---|---|---|---|---|
Mage-Flow-4B-Base |
text→image | Base | 30 | 🤗 microsoft/Mage-Flow-Base |
Mage-Flow-4B |
text→image | RL-aligned | 20 | 🤗 microsoft/Mage-Flow |
Mage-Flow-4B-Turbo |
text→image | Few-step distilled | 4 | 🤗 microsoft/Mage-Flow-Turbo |
Mage-Flow-Edit-4B-Base |
editing | Base | 30 | 🤗 microsoft/Mage-Flow-Edit-Base |
Mage-Flow-Edit-4B |
editing | RL-aligned | 30 | 🤗 microsoft/Mage-Flow-Edit |
Mage-Flow-Edit-4B-Turbo |
editing | Few-step distilled | 4 | 🤗 microsoft/Mage-Flow-Edit-Turbo |
Mage 家族還包含一個即將推出的 Mage-VL,定位為 4B 參數的圖片與影片理解模型,採用 codec-native 串流架構,同樣從零訓練。
Hugging Face Spaces 上的 microsoft/mage-flow 提供了即時試用介面,使用者可上傳圖片並輸入編輯指令,直接在瀏覽器中體驗 Mage-Flow-Edit 的效果,無需本地安裝。Space 在 ZeroGPU 基礎設施上執行,目前已有兩個 Spaces 使用 Mage-Flow-Turbo 模型。
試玩 Mage-Flow 請點我
對本地 AI 運算而言,18 到 20 GB 的峰值記憶體讓 Mage-Flow 可以在配備 24GB VRAM 的消費級顯示卡上執行,AMD Strix Halo 等 APU 平台也能勝任。結合 ComfyUI 整合的即將到來,Mage-Flow 有潛力成為本地圖像生成與編輯的主力工具之一,有能力架設的朋友也可以試試本地端運行。





