Pular para o conteúdo
Rota Nacional

Radar ·

Modelo grande alterna entre GPU, RAM e NVMe

Relato publicado em 12 de setembro de 2026 descreve a execução de um modelo em uma RTX 5090, com 125,7 GiB de RAM e parte de um arquivo GGUF de 502 GB no NVMe.

Um relato publicado em 12 de setembro de 2026 descreve a execução de um modelo de linguagem em uma GPU RTX 5090, com 125,7 GiB de RAM. Parte de um arquivo GGUF de 502 GB permanecia armazenada em NVMe, em vez de caber inteiramente na memória da GPU ou na RAM.

O autor informa uma velocidade de 5,12 tokens por segundo para conteúdo novo e de até 21,27 tokens por segundo quando os dados já estavam residentes. Os números são resultados relatados para essa configuração; não demonstram desempenho universal. Para avaliar o método, consulte a publicação original e confira hardware, condições do teste e definição de dados residentes antes de comparar resultados.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis