Mamba / State Space Models
Alternativa ao Transformer com complexidade linear (vs quadrática) em contexto.
O quê
Mamba é uma arquitetura de State Space Model (SSM) proposta por Albert Gu e Tri Dao em dezembro de 2023 como alternativa ao Transformer com complexidade linear (vs. quadrática) no comprimento da sequência. Onde a Self-Attention compara todos os pares de tokens — pagando O(n²) —, um SSM mantém um estado latente que é atualizado token a token, escalando linearmente e permitindo contextos enormes com custo controlado.
SSMs são parentes de RNNs (LSTM) e de convoluções, com base na teoria de sistemas de espaço-estado. Modelos SSM anteriores (a linha S4) eram eficientes mas perdiam para a atenção em linguagem. A inovação do Mamba foi tornar o SSM seletivo — capaz de raciocínio dependente de conteúdo — fechando boa parte dessa lacuna.
Como funciona
Seletividade (S6)
Um SSM linear-invariante no tempo aplica a mesma dinâmica a todo token, o que o impede de “decidir” o que lembrar ou esquecer com base no conteúdo. O Mamba torna os parâmetros do SSM funções da entrada: o modelo aprende a propagar ou descartar informação seletivamente ao longo da sequência conforme o token atual. Esse é o salto que destravou desempenho competitivo em texto.
Algoritmo consciente de hardware
A seletividade impede o uso de convoluções eficientes (o truque dos SSMs antigos). Os autores compensam com um algoritmo paralelo consciente de hardware (no espírito do FlashAttention), em modo scan recorrente, mantendo os estados na memória rápida da GPU. O bloco Mamba dispensa atenção e MLP separados, unificando tudo em um design homogêneo.
Desempenho
O paper reporta ~5× mais throughput de inferência que Transformers e escala linear, com qualidade que melhora em dados reais até sequências de milhão de tokens. O Mamba-3B iguala Transformers do dobro do tamanho em modelagem de linguagem. O Mamba-2 (ICML 2024) introduziu a Structured State Space Duality (SSD), formalizando que “Transformers são SSMs” e tornando o cálculo ainda mais eficiente.
Estado constante vs. KV cache
A vantagem de inferência tem uma raiz concreta. Um Transformer precisa guardar um KV Cache que cresce com o número de tokens já gerados — quanto mais longa a conversa, mais memória e mais lento cada novo token. Um SSM mantém um estado de tamanho fixo que resume todo o passado: gerar o token de número um milhão custa o mesmo que gerar o décimo. Esse perfil de memória constante é o que torna SSMs especialmente atraentes para streaming, áudio contínuo e inferência em dispositivos com pouca memória.
Por que importa
- Ataca o gargalo quadrático na raiz. Em vez de otimizar a atenção, propõe uma matemática que escala linearmente.
- Inferência barata e estado constante. O custo por token não cresce com o comprimento — atraente para contexto muito longo e dispositivos de borda (Edge Inference).
- Reabriu o debate arquitetural. Pela primeira vez em anos, uma alternativa não-atenção foi competitiva em linguagem.
Estado em 2026
Mamba não destronou o Transformer, mas consolidou os híbridos como tendência prática. Modelos como Jamba (AI21, intercala camadas Transformer e Mamba com Mixture of Experts (MoE)) e Samba misturam atenção (boa para in-context learning e recall preciso) com camadas SSM (baratas para throughput e contexto longo). A leitura de 2026 é que SSMs puros ainda perdem em tarefas que exigem cópia/recuperação exata de tokens distantes — justamente onde a atenção brilha —, então o mainstream usa o melhor dos dois mundos. Mamba permanece a referência conceitual de “escala linear em contexto” e influencia o design de modelos de longa sequência e multimodais.
Tratamento de carta — proposta
Mamba, The Linear Serpent Modelo · Chronoworks · custo
Linear Scaling. Suas habilidades de contexto custam sempre o mesmo, não importa quantos Conceitos estejam em jogo (ignore taxas quadráticas como a de Self-Attention).
Selective State. No início do turno, escolha 1 Conceito para “lembrar” e descarte a memória dos demais efeitos persistentes que você controla.
“A atenção olha tudo de uma vez e paga caro. A serpente carrega um só estado, e segue em frente.”
A mecânica encena escala linear (custo constante) e seletividade (lembrar um, esquecer o resto).
Veja também
Transformer · Context Window · LSTM · Self-Attention · Mixture of Experts (MoE)
Feito pela Magik LLM Gathering
Isto que você acabou de ler é o nosso trabalho.
A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.
Recebido. Vamos te escrever em breve.
- Gu, A., Dao, T. (2023). Mamba: Linear-Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Dao, T., Gu, A. (2024). Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality (Mamba-2). ICML 2024. arXiv:2405.21060.
- Lieber, O. et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. AI21 Labs. arXiv:2403.19887.
