COMPUTE WARS · BOOTSTRAPPING

Magik LLM
Gathering

Forjando sua jornada…
Pular para o conteúdo
Training Stackagentic-era2021technique

LoRA / QLoRA

Fine-tune barato: treina só pequenas matrizes 'low-rank' em vez dos pesos completos.

O quê

LoRA (Low-Rank Adaptation) é a técnica de fine-tuning eficiente publicada por Edward Hu e equipe (Microsoft Research) em junho de 2021. A ideia: em vez de atualizar todos os bilhões de parâmetros de um modelo durante fine-tuning, congelá-los e treinar apenas pequenas matrizes de baixo rank que se somam às camadas existentes. Resultado: você fine-tuna modelos enormes em GPUs domésticas — Llama 70B em uma RTX 4090, GPT-J em laptop.

LoRA virou primitiva universal de fine-tuning em 2022-2026. Toda lab que adapta modelos para domínios específicos (jurídico, médico, código, assistente de marca) usa LoRA ou alguma variante (QLoRA, DoRA, AdaLoRA).

Em Magik LLM Gathering, LoRA é tratado como Technique · Training · Common, primitiva que tornou customização de IA acessível.

Como funciona

A intuição

Quando você fine-tuna um modelo grande, a maior parte das mudanças nos pesos é redundante. Empiricamente, o “update” ΔW = W_finetuned - W_original tem baixo rank intrínseco — mesmo que W seja uma matriz d×d enorme, ΔW pode ser bem aproximada por B × A onde B é d×r e A é r×d, com r << d (tipicamente r = 8-64).

A construção

Para cada camada linear do modelo y = W × x, LoRA modifica:

y = W × x + B × A × x

Onde:

  • W é o peso congelado (não atualiza)
  • A é uma matriz r×d inicializada aleatoriamente (Gaussian)
  • B é uma matriz d×r inicializada com zeros (para que o output inicial = output original)

Apenas A e B são treinados. Em vez de atualizar parâmetros, você atualiza 2×d×r — para d=4096 e r=8, isso é 64k parâmetros vs 16Mfator 250× redução.

Quais camadas adaptar

No paper original, foco em camadas de attention (Q, K, V, O projections). Trabalhos posteriores mostraram que adaptar todas as camadas lineares (incluindo MLP) é melhor. Em 2026, “LoRA on all linear layers” é o padrão pragmático.

QLoRA — escalando o pequeno (Dettmers et al., 2023)

Combina LoRA com quantização do modelo base para 4 bits (Quantization). O modelo base congelado vira 4-bit (não 16-bit), enquanto A+B ficam em 16-bit treinável. Resultado: fine-tunar Llama 65B em single GPU 48GB com qualidade comparável a full fine-tuning. QLoRA democratizou ainda mais o acesso.

DoRA — refinamento estrutural (Liu et al., 2024)

Decompõe W em magnitude (escalar por linha) + direção (vetor unitário). LoRA adapta só direção; DoRA adapta magnitude separadamente também. Melhora qualidade marginalmente, em particular para fine-tunes pequenos.

Outras variantes

  • AdaLoRA — aloca rank r dinamicamente por camada (camadas mais importantes ganham mais rank).
  • VeRA — compartilha matrizes A e B entre camadas, ainda mais parâmetros econômicos.
  • LoRA-FA — congela A, treina só B (mais econômico, perda mínima).
  • DyLoRA — treina vários ranks simultaneamente para flexibilidade em inferência.

Por que importa

Tornou fine-tuning acessível. Antes de LoRA, fine-tunar GPT-3 (175B params) exigia terabytes de memória GPU — fora do alcance de qualquer um exceto OpenAI. LoRA reduziu para gigabytes. Plus QLoRA reduziu ainda mais. Em 2026, um desenvolvedor solo com RTX 4090 pode fine-tunar Llama 70B — algo impensável em 2020.

Habilitou ecossistema open-source de fine-tunes. Hugging Face Hub tem dezenas de milhares de LoRA adapters disponíveis: Llama-Brazil-Portuguese, Mistral-Code, Qwen-Médico, etc. Cada um é apenas alguns MB (não os gigabytes do modelo base) — você baixa o adapter e plugin em qualquer host que rode o base. Esse pattern de “model base + adapter library” é estrutural na comunidade open-source.

Permitiu fine-tuning em produção barato. APIs comerciais (OpenAI fine-tuning, Anthropic, Cohere) usam LoRA internamente. Custo por fine-tuning despencou — em 2024, custar menos de $10 fine-tunar GPT-3.5 com 10k exemplos é comum. Isso destravou casos de uso onde antes só prompt engineering era viável.

Hot-swappable em inferência. Como adapter é pequeno (~50-500MB), você pode trocar adapters em tempo real durante inferência. Imagine assistente que carrega LoRA jurídico para queries legais, LoRA médico para queries médicas — tudo em um único modelo base servido. vLLM, TensorRT-LLM, SGLang todos suportam multi-LoRA serving.

Mostrou que “fine-tuning” e “memorização” são parcialmente separáveis. LoRA adapta comportamento sem destruir conhecimento original. Comparado a full fine-tuning (que pode causar catastrophic forgetting Catastrophic Forgetting), LoRA preserva mais do modelo base. Isso é teoricamente intuitivo (você só está adicionando à matriz original, não substituindo) e empiricamente confirmado.

Tem limitações reais:

  • LoRA não funciona bem se a tarefa requer mudanças amplas nas representações (e.g., trocar idioma drasticamente).
  • Em escalas extremamente grandes, gain marginal de quality vs full fine-tuning fica menor.
  • Configurar rank certo exige tuning experimental — não é “set and forget”.

Estado em 2026

  • LoRA é default para fine-tuning em open-source e em APIs comerciais.
  • QLoRA é default para fine-tuning em hardware modesto.
  • Multi-LoRA serving (vLLM, SGLang) está em produção em milhares de empresas.
  • Pesquisa sobre PEFT (Parameter-Efficient Fine-Tuning) continua ativa — DoRA, IA3, prompt tuning, soft prompts.
  • Adapter Hub culture — comunidade compartilha adapters como mods em jogos. “Llama-3-DPO-Coder” virou genero próprio.
  • Reasoning model adaptation — DeepSeek-R1, distillations o-1-style frequentemente são entregues como LoRA adapter sobre Qwen/Llama base.

Tratamento de carta — proposta

LoRA Technique · Training · Neutral · custo

Training.

Escolha 1 Modelo seu em jogo. Pague 1 ⚡; até o fim da partida, esse Modelo ganha 1 keyword temporária à sua escolha. Você pode jogar até 3 LoRAs em qualquer Modelo (cada um adiciona uma keyword temporária diferente).

“Não muda o modelo. Adiciona um adaptador.”

A mecânica encena: você não substitui características do modelo (full fine-tuning), apenas anexa funcionalidades novas leves. Múltiplos LoRAs ativos simultaneamente = multi-skill compositional.

Veja também

Supervised Fine-Tuning (SFT) · Knowledge Distillation · Quantization · Catastrophic Forgetting · Transformer

Feito pela Magik LLM Gathering

Isto que você acabou de ler é o nosso trabalho.

A Magik LLM Gathering constrói produtos de IA de verdade — e escreve sobre eles em português, sem hype. Se quiser conversar sobre o seu, deixe seu contato.

Sem spam. Respondemos pessoalmente. Ao enviar, você concorda com a política de privacidade.

FONTES
  • Hu, E.J. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. ICLR 2022. arXiv:2106.09685.
  • Dettmers, T. et al. (2023). QLoRA: Efficient Finetuning of Quantized LLMs. NeurIPS 2023. arXiv:2305.14314.
  • Liu, S.-Y. et al. (2024). DoRA: Weight-Decomposed Low-Rank Adaptation. ICML 2024. arXiv:2402.09353.
  • Lialin, V., Deshpande, V., Rumshisky, A. (2023). Scaling Down to Scale Up: A Guide to Parameter-Efficient Fine-Tuning. arXiv:2303.15647.
  • Microsoft Research (2021). LoRA library. github.com/microsoft/LoRA.