Publicado em 23 de julho de 2026, o anúncio descreve um dataset com cerca de 5 trilhões de tokens em 713 linguagens e 224 milhões de repositórios, coletados até agosto de 2025.
O anúncio de 23 de julho de 2026 apresenta o The Stack v3, um dataset com cerca de 5 trilhões de tokens de código-fonte, distribuídos por 713 linguagens filtradas e 224 milhões de repositórios. A coleta do GitHub que fundamenta o conjunto foi concluída até agosto de 2025.
Segundo a descrição, engenheiros podem usar o código como fonte para treinar ou fazer fine-tuning de modelos. Para conferir o escopo e os detalhes, consulte o anúncio original e verifique as informações sobre cobertura, filtros, data de coleta e condições de uso do dataset.