Pular para o conteúdo
Rota Nacional

Radar ·

Llama 3.1 8B em uma RTX 3090 sob carga

Publicado em 16 de agosto de 2024, o resumo relata um benchmark com Llama 3.1 8B em fp16 numa RTX 3090: o desempenho em tokens por segundo foi considerado razoável com mais de 100 requisições simultâneas.

Publicado em 16 de agosto de 2024, o post do blog da Backprop relata um benchmark de inferência do Llama 3.1 8B em fp16 numa RTX 3090. Segundo o resumo, o teste encontrou uma taxa de tokens por segundo considerada razoável com mais de 100 requisições simultâneas.

O resultado oferece uma referência para avaliar inferência em uma única GPU sob carga concorrente; não informa, neste resumo, valores numéricos nem detalhes adicionais da configuração. Para conferir o achado, consulte o post original e verifique os parâmetros, a carga e as métricas nele apresentados.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis