Publicado em 23 de julho de 2026, o anúncio descreve um dataset aberto com cerca de 5 trilhões de tokens de código-fonte deduplicado e filtrado, em 713 linguagens. Segundo a publicação, foram excluídos códigos com licenças restritivas.
O anúncio de 23 de julho de 2026 apresenta o The Stack v3 como um dataset aberto com cerca de 5 trilhões de tokens de código-fonte deduplicado e filtrado, abrangendo 713 linguagens. A publicação afirma que o conjunto exclui código com licenças restritivas. Para engenheiros que treinam modelos de código, a escala e a variedade de linguagens podem servir de base para avaliar um conjunto de dados mais amplo.
Para verificar o alcance dessas afirmações, consulte a publicação original e a documentação do dataset, conferindo como foram definidos a deduplicação, a filtragem e os critérios de licença. Se usar IA para estudar ou aplicar o material, evite enviar código proprietário, credenciais ou dados pessoais; confirme também os direitos e as condições de uso do código antes de incorporá-lo a um projeto.