Paper compara seis métodos de pruning do Llama-3.1-8B com treino do zero em dois cenários de orçamento de tokens. A vantagem depende de como o orçamento é contabilizado e da granularidade do pruning.
Publicado em 5 de julho de 2026, o paper compara seis métodos de pruning aplicados ao Llama-3.1-8B com o treino de modelos do zero, em dois cenários de orçamento de tokens. O estudo examina alternativas para engenheiros que avaliam como obter modelos menores.
Com a mesma quantidade de tokens para retreino, os modelos podados levam vantagem. Quando se considera o orçamento total do pipeline, porém, o resultado depende da granularidade do pruning. Consulte o paper original para conferir métodos, condições e resultados completos; não extrapole a conclusão para outros modelos ou orçamentos sem verificar os dados.