Publicado em 16 de agosto de 2024, o resumo relata um benchmark com Llama 3.1 8B em fp16 numa RTX 3090: o desempenho em tokens por segundo foi considerado razoável com mais de 100 requisições simultâneas.
Publicado em 16 de agosto de 2024, o post do blog da Backprop relata um benchmark de inferência do Llama 3.1 8B em fp16 numa RTX 3090. Segundo o resumo, o teste encontrou uma taxa de tokens por segundo considerada razoável com mais de 100 requisições simultâneas.
O resultado oferece uma referência para avaliar inferência em uma única GPU sob carga concorrente; não informa, neste resumo, valores numéricos nem detalhes adicionais da configuração. Para conferir o achado, consulte o post original e verifique os parâmetros, a carga e as métricas nele apresentados.