COMPUTE WARS · BOOTSTRAPPING

Magik LLM
Gathering

Forjando sua jornada…
Pular para o conteúdo
Data & Corporaagentic-era2022dataset

The Stack

Corpus open-source de código (BigCode/HuggingFace). Base de Code Llama, StarCoder, etc.

O quê

The Stack é um corpus open-source de código-fonte criado pelo projeto BigCode (colaboração entre HuggingFace e ServiceNow, iniciada em set/2022). É a base de dados de treino por trás de modelos de código abertos como SantaCoder, StarCoder e StarCoder2.

A v1 (Kocetkov et al., nov/2022) reuniu 3,1 TB de código sob licenças permissivas (MIT, Apache e similares) em 30 linguagens de programação. A v2 (fev/2024, junto com StarCoder2) deu um salto enorme: construída sobre o arquivo Software Heritage, chega a ~67 TB brutos (32 TB deduplicados) em 600+ linguagens, agrupada por repositório para dar contexto de projeto inteiro ao modelo.

Em Magik LLM Gathering, é tratado como dataset · companion — o combustível dos modelos que escrevem código.

Como funciona

Filtro de licença como princípio de design

A decisão central do The Stack é treinar apenas em código permissivamente licenciado, não em tudo que está no GitHub. Isso exigiu detecção de licença por arquivo/repositório e descarte do que não é claramente permissivo — uma postura de governança de dados explícita, em contraste com a opacidade dos datasets fechados.

Governança: “Am I in The Stack” e opt-out

O BigCode publicou a ferramenta “Am I in The Stack”, onde qualquer dev verifica se seu código foi incluído, e um processo de opt-out para remoção. Foi uma tentativa pioneira de tratar consentimento e proveniência em corpora de treino.

Deduplicação e contexto de repositório

Near-deduplication melhora desempenho em todos os experimentos (achado central do paper v1). A v2 inovou ao agrupar por repositório em vez de tratar arquivos soltos — permitindo treinar modelos que enxergam um projeto como um todo (imports, módulos, estrutura), o que casa com objetivos como Fill-in-the-Middle.

Por que importa

Viabilizou code LLMs abertos. StarCoder (15B, mai/2023) foi, no lançamento, o melhor LLM de código de acesso aberto — possível só porque havia um corpus de código aberto e auditável para treiná-lo. StarCoder2-15B treinou em 4+ trilhões de tokens da v2.

Pôs a governança de dados na pauta. O opt-out e o filtro de licença viraram referência num debate quente: pode-se treinar IA em código alheio? The Stack tentou uma resposta responsável, ainda que parcial.

É infraestrutura de produtividade. Todo assistente de código aberto (e muitos fechados) descende de modelos treinados sobre corpora como este — o que conecta diretamente ao fenômeno do Vibe Coding.

Estado em 2026

  • The Stack v2 é o maior dataset de código aberto adequado a pré-treino, sustentando a família StarCoder2 e derivados.
  • Disputas de copyright seguem. Ações judiciais sobre treino em código (e a tensão com licenças copyleft, não incluídas) continuam sem resolução definitiva.
  • Contexto de repositório virou padrão. Modelos de código modernos esperam ver projetos inteiros, não arquivos isolados — direção que a v2 antecipou.
  • Complementa corpora gerais. Misturas de pré-treino combinam código (The Stack) com web (RedPajama / Dolma / FineWeb, Common Crawl) para modelos generalistas.

Tratamento de carta — proposta

The Stack Site (dados) · Foundry

Toque: revele a carta do topo do deck. Se for um Construct ou Técnica (código), compre-a; senão, devolva ao topo. Cartas adquiridas por The Stack entram com a nota “licença permissiva” (não podem ser confiscadas pelo oponente).

“Três terabytes de código que alguém deixou você usar.”

A mecânica encena seleção de código permissivo (só certos tipos passam) e a proteção legal das licenças abertas.

Veja também

Common Crawl · RedPajama / Dolma / FineWeb · Vibe Coding · The Vibe Coder

Feito pela Magik LLM Gathering

Isto que você acabou de ler é o nosso trabalho.

A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.

Sem spam. Respondemos pessoalmente. Ao enviar, você concorda com a política de privacidade.

FONTES
  • Kocetkov, D. et al. (2022). The Stack: 3 TB of permissively licensed source code. arXiv:2211.15533.
  • Lozhkov, A. et al. (2024). StarCoder 2 and The Stack v2: The Next Generation. arXiv:2402.19173.
  • BigCode (2022-2024). Projeto BigCode (ServiceNow + HuggingFace). bigcode-project.org.