Novo motor em C executa modelos de IA com 744 bilhões de parâmetros em PCs comuns
O motor Colibrì organiza disco, RAM e VRAM em camada única para rodar redes neurais avançadas sem exigir placas gráficas industriais de alto custo.
O motor Colibrì organiza disco, RAM e VRAM em camada única para rodar redes neurais avançadas sem exigir placas gráficas industriais de alto custo.
O Colibrì é um motor de inferência em linguagem C criado por JustVugg para executar modelos de fronteira em computadores convencionais. O projeto ganhou destaque no GitHub Trending semanal e alcançou o 19º lugar mensal no Trendshift após registrar 11.036 estrelas recentes. A ferramenta soluciona a escassez de infraestrutura ao rodar redes neurais de 744 bilhões de parâmetros em máquinas com apenas 25 gigabytes de RAM.
Grandes modelos de inteligência artificial exigem placas corporativas com ampla memória de vídeo, conhecida como VRAM. Em equipamentos comuns, a capacidade limitada dessa memória impede a execução de redes com centenas de bilhões de parâmetros. Esse entrave afeta principalmente arquiteturas baseadas em mistura de especialistas, técnica conhecida como MoE que subdivide a rede neural em blocos especializados.
O projeto elimina essa restrição ao unificar o armazenamento em disco, a memória RAM e a VRAM em uma camada contínua de processamento. Em vez de alocar todo o modelo em memória rápida de alto custo, o sistema transmite os pesos dos especialistas diretamente do disco durante a inferência. Essa estrutura possibilita que computadores domésticos ou baseados apenas em processadores comuns processem modelos que variam de 744 bilhões a 2,8 trilhões de parâmetros.
A estratégia também descarta camadas intermediárias pesadas que costumam inflar motores convencionais. A ausência de dependências externas diminui a sobrecarga no sistema e favorece a velocidade de transferência de dados. O mecanismo mantém fidelidade matemática total aos pesos originais, impedindo redefinições silenciosas na precisão da rede.
O funcionamento do motor equilibra a velocidade de entrada e saída do disco com o ciclo de processamento matemático. Quando uma mensagem chega ao sistema, o roteador da arquitetura seleciona apenas os especialistas necessários para processar aquele trecho. Os módulos indicados são lidos continuamente da unidade de armazenamento e integrados à inferência sem alterar as taxas originais de quantização.
A base de código traz implementações em arquivos individuais escritos na linguagem C para cada modelo suportado. As ferramentas compartilham a mesma interface de terminal, permitindo iniciar conversas interativas ou conectar clientes externos. A execução padrão do chat no terminal pode ser acionada com o comando demonstrado a seguir:
./coli chat
O binário inicializa em poucos segundos, mantendo residente na memória principal apenas o núcleo estritamente necessário. O comando ./coli web abre um painel gráfico com métricas em tempo real sobre a hierarquia de armazenamento dos módulos. A interface também traz diagnósticos de telemetria que detalham a sobreposição entre a leitura física de dados e o processamento dos cálculos.
Soluções convencionais de inferência priorizam vazão máxima e exigem que todos os parâmetros fiquem permanentemente na memória de vídeo. Ao atingir o limite físico da máquina, muitas ferramentas falham ou modificam a precisão numérica sem autorização do usuário. O Colibrì adota a diretriz de aceitar menor velocidade em troca de preservar a precisão original dos pesos e as decisões do roteador de especialistas.
Outro ponto distintivo é a simplicidade da base de código. Enquanto soluções industriais exigem extensas cadeias de dependências e interpretadores auxiliares, o motor utiliza código puro em C. A divisão de cada arquitetura em arquivo único facilita auditorias independentes e viabiliza compilações diretas em sistemas heterogêneos.
O repositório é regido pela licença Apache-2.0, oferecendo termos claros para reprodução e modificação do código. Criado em primeiro de julho de 2026 e atualizado com a versão v1.12.1 em vinte e quatro de setembro de 2026, o software possui 90 issues abertas e permanece em evolução. O desenvolvedor esclarece que não existem garantias de tempo de resposta, fazendo com que o desempenho dependa da taxa de leitura do disco local.
Tópicos temáticos não foram informados no repositório, demandando que o usuário avalie a adequação aos seus fluxos de trabalho. A transmissão constante de arquivos de grande volume pode acelerar o desgaste de unidades de estado sólido sob uso intenso. O uso em redes externas requer cuidados adicionais de isolamento, e o comportamento em certas configurações heterogêneas demanda testes individuais de compatibilidade.