Pular para o conteúdo
Rota Nacional

Radar ·

SGLang e vLLM: throughput em GPUs A6000

Publicado em 4 de agosto de 2024, o relato compara dois mecanismos de serving com Mistral Large 2 em quatro GPUs A6000: cerca de 1.100 tokens/s com SGLang e menos de 750 com vLLM; em batches menores, o desempenho foi semelhante.

Em 4 de agosto de 2024, um engenheiro relatou ter substituído o vLLM pelo SGLang em um pipeline local de geração de dados. Com Mistral Large 2 em 4 bits, executado em quatro GPUs A6000, observou cerca de 1.100 tokens por segundo com SGLang, contra menos de 750 com vLLM.

O relato diz que, em batches menores, o desempenho foi semelhante. A comparação destaca que o throughput pode variar conforme o mecanismo de serving e o tamanho do batch, mesmo com o mesmo modelo e hardware; não estabelece que os resultados se generalizem a outras configurações. Consulte a publicação original para verificar o contexto e os números. Se usar IA para estudar ou aplicar o relato, evite incluir dados organizacionais sensíveis sem antes aplicar as políticas de proteção da sua organização.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis