ntransformer afirma executar Llama 70B em RTX 3090
Publicado em 22 de fevereiro de 2026, o registro descreve um engine de inferência em C++/CUDA que afirma executar Llama 70B em uma RTX 3090, com transferência de NVMe para GPU sem passar pela CPU.
O registro de 22 de fevereiro de 2026 apresenta o ntransformer como um engine de inferência de modelos de linguagem, escrito em C++/CUDA. Segundo a descrição da página do projeto, ele executa Llama 70B em uma RTX 3090 e transfere dados do NVMe para a GPU sem passar pela CPU.
A afirmação pode interessar a engenheiros que avaliam a execução de modelos grandes em uma única GPU de consumo. Para verificar o resultado, consulte a página original do projeto e confira as instruções, os requisitos de hardware e os métodos de teste disponíveis; o registro não informa números de desempenho nem detalhes adicionais da configuração.