Microsoft lança Mage-Flow 4B que gera e edita em resolução nativa batendo modelos de 32B
Família compacta usa tokenizer 22× mais leve e roda em 18–20 GB de VRAM na A100
Família compacta usa tokenizer 22× mais leve e roda em 18–20 GB de VRAM na A100
Microsoft lançou o Mage-Flow em 21 de julho de 2026, uma família de 4 bilhões de parâmetros que faz geração de imagem a partir de texto e edição baseada em instruções com um único backbone compartilhado. O modelo opera em resolução nativa de 512 a 2048 pixels em qualquer proporção, incluindo 4:1 extremo como 512×2048, e atinge qualidade competitiva com sistemas abertos de 20 a 32 bilhões de parâmetros como Qwen-Image 20B, Z-Image 6B, FLUX.2 32B e FireRed-Image-Edit 20B. Publicado sob licença MIT no Hugging Face, o pacote traz seis checkpoints prontos para diffusers no formato safetensors.
A arquitetura co-projetada divide o trabalho entre o Mage-VAE e o NR-MMDiT. O Mage-VAE é um tokenizador latente de difusão de um passo com regularização KL de latente-âncora que iguala a fidelidade de reconstrução do FLUX.2-VAE consumindo 12 vezes menos MACs na codificação e 22 vezes menos na decodificação por pixel, removendo o VAE como gargalo de alta resolução. O NR-MMDiT é o transformer multimodal de 4B treinado com rectified flow matching no espaço latente do VAE.
O empacotamento nativo de resolução com FlashAttention var-len e RoPE 2D por amostra cortou o tempo de treino por passo de 1,93 para 0,78 segundos — ganho de 2,5 vezes. Os ramos condicional e incondicional do guidance livre de classificador rodam em um único forward empacotado. Um único checkpoint cobre de 512×512 até 2048×2048 e proporções extremas como 512×2048 sem redimensionamento ou padding forçado.
O Model Zoo lista seis repositórios autocontidos: Mage-Flow-4B-Base (30 passos), Mage-Flow-4B alinhado por RL (20 passos), Mage-Flow-4B-Turbo destilado (4 passos), e os três espelhos para edição — Mage-Flow-Edit-4B-Base (30 passos), Mage-Flow-Edit-4B (30 passos) e Mage-Flow-Edit-4B-Turbo (4 passos). Cada checkpoint contém quatro arquivos de peso em safetensors mais VAE, text encoder e scheduler compartilhados.
Em inferência na A100 a 1024², o Mage-Flow-Turbo gera imagem em 0,59 segundos e o Edit-Turbo edita em 1,02 segundos, com pico de memória entre 18 e 20 GB — o menor consumo entre os sistemas comparados no relatório. A família acumula 2.007 downloads no último mês e 415 curtidas no Hugging Face, com código apontado para a pipeline MageFlowPipeline do diffusers e artigo no arXiv 2607.19064.
O Mage-Flow-Edit suporta edição semântica de conteúdo, transformação de aparência, restauração de imagem e saídas conscientes de estrutura em modelo unificado condicionado a imagem e texto. O sistema entrega diversidade um-para-muitos: a partir de uma única imagem de referência gera múltiplas saídas válidas. O showcase demonstra renderização de texto legível em inglês e chinês, retratos, culinária e cenas gerais.
A licença MIT permite uso comercial, modificação e distribuição sem copyleft, liberando integração em produtos proprietários sem obrigação de abrir código derivado. Não há cláusula de uso responsável ou restrição de domínio no texto da licença, diferentemente de licenças como OpenRAIL.
O lançamento posiciona a Microsoft no eixo de pesos abertos eficientes que trocam escala bruta por co-design de tokenizer, backbone e infraestrutura de kernels fundidos. Para desenvolvedores no Brasil, o modelo roda em GPUs de workstation de última geração e instâncias de nuvem acessíveis, dispensando clusters de treinamento dedicados.