The Stack
Corpus open-source de código (BigCode/HuggingFace). Base de Code Llama, StarCoder, etc.
O quê
The Stack é um corpus open-source de código-fonte criado pelo projeto BigCode (colaboração entre HuggingFace e ServiceNow, iniciada em set/2022). É a base de dados de treino por trás de modelos de código abertos como SantaCoder, StarCoder e StarCoder2.
A v1 (Kocetkov et al., nov/2022) reuniu 3,1 TB de código sob licenças permissivas (MIT, Apache e similares) em 30 linguagens de programação. A v2 (fev/2024, junto com StarCoder2) deu um salto enorme: construída sobre o arquivo Software Heritage, chega a ~67 TB brutos (32 TB deduplicados) em 600+ linguagens, agrupada por repositório para dar contexto de projeto inteiro ao modelo.
Em Magik LLM Gathering, é tratado como dataset · companion — o combustível dos modelos que escrevem código.
Como funciona
Filtro de licença como princípio de design
A decisão central do The Stack é treinar apenas em código permissivamente licenciado, não em tudo que está no GitHub. Isso exigiu detecção de licença por arquivo/repositório e descarte do que não é claramente permissivo — uma postura de governança de dados explícita, em contraste com a opacidade dos datasets fechados.
Governança: “Am I in The Stack” e opt-out
O BigCode publicou a ferramenta “Am I in The Stack”, onde qualquer dev verifica se seu código foi incluído, e um processo de opt-out para remoção. Foi uma tentativa pioneira de tratar consentimento e proveniência em corpora de treino.
Deduplicação e contexto de repositório
Near-deduplication melhora desempenho em todos os experimentos (achado central do paper v1). A v2 inovou ao agrupar por repositório em vez de tratar arquivos soltos — permitindo treinar modelos que enxergam um projeto como um todo (imports, módulos, estrutura), o que casa com objetivos como Fill-in-the-Middle.
Por que importa
Viabilizou code LLMs abertos. StarCoder (15B, mai/2023) foi, no lançamento, o melhor LLM de código de acesso aberto — possível só porque havia um corpus de código aberto e auditável para treiná-lo. StarCoder2-15B treinou em 4+ trilhões de tokens da v2.
Pôs a governança de dados na pauta. O opt-out e o filtro de licença viraram referência num debate quente: pode-se treinar IA em código alheio? The Stack tentou uma resposta responsável, ainda que parcial.
É infraestrutura de produtividade. Todo assistente de código aberto (e muitos fechados) descende de modelos treinados sobre corpora como este — o que conecta diretamente ao fenômeno do Vibe Coding.
Estado em 2026
- The Stack v2 é o maior dataset de código aberto adequado a pré-treino, sustentando a família StarCoder2 e derivados.
- Disputas de copyright seguem. Ações judiciais sobre treino em código (e a tensão com licenças copyleft, não incluídas) continuam sem resolução definitiva.
- Contexto de repositório virou padrão. Modelos de código modernos esperam ver projetos inteiros, não arquivos isolados — direção que a v2 antecipou.
- Complementa corpora gerais. Misturas de pré-treino combinam código (The Stack) com web (RedPajama / Dolma / FineWeb, Common Crawl) para modelos generalistas.
Tratamento de carta — proposta
The Stack Site (dados) · Foundry
Toque: revele a carta do topo do deck. Se for um Construct ou Técnica (código), compre-a; senão, devolva ao topo. Cartas adquiridas por The Stack entram com a nota “licença permissiva” (não podem ser confiscadas pelo oponente).
“Três terabytes de código que alguém deixou você usar.”
A mecânica encena seleção de código permissivo (só certos tipos passam) e a proteção legal das licenças abertas.
Veja também
Common Crawl · RedPajama / Dolma / FineWeb · Vibe Coding · The Vibe Coder
Feito pela Magik LLM Gathering
Isto que você acabou de ler é o nosso trabalho.
A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.
Recebido. Vamos te escrever em breve.
- Kocetkov, D. et al. (2022). The Stack: 3 TB of permissively licensed source code. arXiv:2211.15533.
- Lozhkov, A. et al. (2024). StarCoder 2 and The Stack v2: The Next Generation. arXiv:2402.19173.
- BigCode (2022-2024). Projeto BigCode (ServiceNow + HuggingFace). bigcode-project.org.
