O Model Optimizer é uma biblioteca aberta em Python criada pela NVIDIA em 23 de abril de 2024 para encolher redes neurais pesadas. O programa comprime modelos em até 3,1 vezes e eleva a velocidade no motor vLLM em 1,30 vez sem perder exatidão técnica. A ferramenta corta gastos com servidores. O código atende engenheiros que colocam modelos de linguagem em produção sem estourar a memória das placas gráficas.

O programa processa pesos localmente e descarta chamadas externas

A biblioteca recebe arquivos estruturados nos formatos Hugging Face, PyTorch ou ONNX e executa transformações direto no computador local. O código junta quantização, poda de conexões, busca de arquitetura, destilação de conhecimento, esparsidade e decodificação especulativa para enxugar os pesos da rede. Para treinar essas etapas em redes gigantescas, o pacote integra as rotinas aos projetos Megatron-Bridge, Megatron-LM e Hugging Face Accelerate. Tudo roda na máquina local.

Depois de ajustar os parâmetros, o sistema exporta arquivos prontos para motores de execução rápida como SGLang, TensorRT-LLM, TensorRT e vLLM. A API unificada da Hugging Face gera saídas tanto para modelos de texto da biblioteca transformers quanto para geradores de imagens do pacote diffusers. Em testes com a rede Qwen3.6-35B-A3B, a combinação do formato NVFP4 W4A4 com destilação e escalas por Hessiana Local recuperou a precisão que a compressão costuma tirar. O sistema recupera a qualidade original.

Na versão 0.47.0, lançada em 23 de setembro de 2026, os desenvolvedores incluíram um conversor em fluxo contínuo para a rede Kimi-K3 de 2,8 trilhões de parâmetros. O módulo lê especialistas roteados em NVFP4 com input_scale=1.0 e pesos de atenção em bloco FP8 de 128x128 fatia por fatia, sem carregar o arquivo bruto inteiro na memória do sistema. A atualização traz a receita Muse Glimmer a 5,5 bits efetivos e o script examples/alpamayo/qad.py, que usa FSDP2 em múltiplos aceleradores para reconstruir o modelo AlpamayoR1. O quantizador ONNX descarta mudanças que não alcancem ganho de 1,02x no TensorRT.

O projeto exige placas aceleradoras e cobra revisão de licenças

Para começar o trabalho, quem desenvolve instala os pacotes estáveis do índice PyPI com o comando pip install -U nvidia-modelopt[all]. Quem planeja programar melhorias ou testar recursos recentes clona o repositório no GitHub e roda pip install -e .[dev] em modo editável. Como caminho alternativo, a NVIDIA publica imagens de contêiner prontas no registro NVCR para os ambientes PyTorch, NeMo e TensorRT-LLM. O processo baixa programas de terceiros com termos próprios de uso. A primeira execução gera o arquivo calibrado.

Com 885 dias de atividade, o repositório reúne 4.403 estrelas, 645 forks e 418 problemas abertos no GitHub. A equipe da empresa mantém o código ativo e registrou o commit mais recente em 25 de setembro de 2026. A licença Apache-2.0 libera o uso comercial e autoriza alterações no código-fonte, mas o programa não ajuda quem roda inferência apenas em processadores comuns de computador. O trabalho depende de aceleradores gráficos compatíveis.

Fontes

PythonApache-2.0IA Local e Self-HostedTrendshift
Como apuramos: as fontes consultadas estão indicadas nesta matéria para que você possa conferir as informações. Os números de estrelas e a posição no ranking refletem o momento da coleta. Conheça os critérios editoriais.