Publicado em 11 de julho de 2026, o Colibri é descrito como um engine de inferência em C, sem dependências, que carrega do disco os experts de modelos MoE conforme necessário. O relato afirma que ele executa um modelo de 744 bilhões de parâmetros em um laptop com 25 GB de RAM.
O post apresenta o Colibri como um engine de inferência escrito em C e sem dependências, com carregamento de experts de modelos MoE sob demanda a partir do disco. Segundo a publicação de 11 de julho de 2026, ele executa o GLM-5.2, descrito como um modelo de 744 bilhões de parâmetros, em um laptop com 25 GB de RAM.
A proposta busca reduzir a memória necessária para executar modelos MoE grandes, trazendo experts à memória conforme são requisitados. Para avaliar o resultado e seus limites, consulte a publicação original e verifique os requisitos, as condições do teste e o método de medição; o resumo disponível não detalha esses pontos.