Como fazer fine-tuning em LLMs: guia completo passo a passo

Do dataset à avaliação: o roteiro prático para adaptar Llama, Mistral e GPT com LoRA, QLoRA e Hugging Face.

Por Marcos Guimarães22 set 2026
Como fazer fine-tuning em LLMs: guia completo passo a passo

Fine-tuning em LLMs é o processo de pegar um modelo de linguagem já treinado, como Llama, Mistral, Gemma ou GPT, e continuar o treinamento com um dataset menor e específico. O processo de ajustar um LLM com dados próprios se chama fine-tuning. O objetivo não é ensinar o modelo a falar português do zero. É moldar comportamento, formato de resposta, tom de voz e domínio de uma tarefa.

Existem dois caminhos principais. O full fine-tuning atualiza todos os pesos do modelo, exige muita memória de GPU e é caro. O PEFT, Parameter-Efficient Fine-Tuning, treina apenas uma fração pequena dos parâmetros. LoRA, Low-Rank Adaptation, é a técnica PEFT mais usada. QLoRA combina LoRA com quantização em 4 bits e reduz ainda mais o hardware necessário.

Use fine-tuning quando a tarefa for repetitiva e bem definida. Exemplos: classificar tickets de suporte, gerar respostas no padrão da empresa, extrair dados de contratos, seguir um formato rígido de saída. Não use fine-tuning para fatos que mudam toda semana. Para isso, RAG, Retrieval-Augmented Generation, costuma ser mais eficiente. Fine-tuning com dados ruidosos também aumenta alucinações, porque o modelo aprende a inventar no mesmo estilo dos exemplos ruins.

Passo 1: Defina a tarefa e o resultado esperado

Antes de baixar qualquer modelo, escreva em uma frase o que ele deve fazer. Exemplo: receber um e-mail de cliente e devolver uma classificação entre reembolso, dúvida técnica e cancelamento. Depois, defina o formato exato da resposta. Isso evita treinar um modelo que acerta o conteúdo, mas erra a estrutura.

Pergunte se o problema realmente pede fine-tuning. Se a resposta depende de uma base de conhecimento atualizada, RAG resolve melhor. Se depende de estilo e formato fixo, fine-tuning brilha. Muitas equipes combinam os dois: RAG para fatos, fine-tuning para comportamento.

Passo 2: Escolha o modelo base

Modelos abertos como Llama, Mistral e Gemma são comuns em fine-tuning local porque permitem controle total e custo previsível. Modelos da OpenAI oferecem fine-tuning via API, o que reduz a operação, mas limita ajustes internos. A escolha depende do orçamento, da privacidade dos dados e da familiaridade do time com Hugging Face.

Modelos menores, com 7 bilhões a 8 bilhões de parâmetros, costumam ser suficientes para tarefas específicas. Modelos maiores podem ser melhores em raciocínio complexo, mas exigem mais VRAM e tempo. Comece pequeno e escale só se a avaliação justificar.

Passo 3: Monte um dataset de qualidade

O dataset é a parte mais importante. Formato comum é JSONL, com pares de instrução e resposta. Cada exemplo deve ser claro, correto e representativo do que o modelo verá em produção. Centenas a poucos milhares de exemplos bem feitos superam milhões de exemplos ruins.

Remova duplicatas, corrija erros de digitação e padronize o formato. Separe uma parte para validação, por exemplo 10% ou 20%, e não use esses dados no treino. Se possível, inclua exemplos negativos e casos de borda. O modelo aprende tanto pelo que vê quanto pelo que não vê.

Passo 4: Prepare o ambiente com Hugging Face

O ecossistema Hugging Face é o mais usado. Instale Transformers para carregar modelos, Datasets para manipular dados, PEFT para LoRA e QLoRA, TRL para treino supervisionado e bitsandbytes para quantização. Um ambiente com PyTorch e CUDA bem configurado evita dor de cabeça.

Se você não tem GPU local, alugue uma instância em nuvem. Para LoRA em modelos de 7B, uma GPU com memória generosa costuma bastar. Para full fine-tuning, a exigência sobe muito. QLoRA permite treinar modelos maiores em hardware mais modesto, com pequena perda de qualidade que pode ser aceitável.

Passo 5: Escolha a técnica: LoRA, QLoRA ou full fine-tuning

LoRA congela os pesos originais e treina matrizes de baixo rank. Isso reduz o número de parâmetros treináveis e o tamanho do checkpoint final. QLoRA quantiza o modelo base em 4 bits e aplica LoRA por cima. Full fine-tuning atualiza tudo e tende a ser mais poderoso, mas também mais caro e propenso a overfitting em datasets pequenos.

Para a maioria dos projetos, LoRA ou QLoRA entregam o melhor custo-benefício. Escolha full fine-tuning apenas quando você tem muitos dados, GPU suficiente e necessidade real de mudança profunda no modelo.

Passo 6: Configure hiperparâmetros com cuidado

Learning rate, épocas, batch size, gradient accumulation e warmup mudam o resultado. Em LoRA, o rank e o alpha definem a capacidade do adaptador. Rank alto aprende mais, mas pode overfittar. Rank baixo é mais estável e barato.

Comece conservador. Monitore a loss de treino e a loss de validação. Se a loss de validação subir enquanto a de treino cai, o modelo está decorando. Aumente dados, reduza épocas ou aplique regularização.

Passo 7: Treine o modelo e monitore a loss

Use SFTTrainer ou Trainer da Hugging Face para conduzir o treino. Acompanhe a loss, o uso de GPU e o tempo por passo. Salve checkpoints intermediários. Assim você compara versões e escolhe a melhor, não apenas a última.

Treinar não é apertar um botão e esquecer. Se a loss ficar estranha, pare. Dados mal formatados, tokens errados ou máscara de labels incorreta são causas comuns. Um treino limpo vale mais que dez tentativas aleatórias.

Passo 8: Avalie com métricas e testes manuais

Avalie com métricas automáticas quando fizer sentido: acurácia, F1, perplexidade. Mas nada substitui uma avaliação humana com casos reais. Crie um conjunto de testes com perguntas que representam o uso diário. Compare o modelo base e o modelo ajustado lado a lado.

Se o modelo ajustado piorar em tarefas gerais, isso pode ser catastrophic forgetting. Nesse caso, reduza o escopo do treino ou misture exemplos gerais no dataset. Fine-tuning não deve destruir o que o modelo já sabe.

Passo 9: Faça o deploy do adaptador

LoRA gera um adaptador que pode ser mesclado ao modelo base ou carregado separadamente. Para servir em produção, opções comuns incluem vLLM, Text Generation Inference e Ollama. Considere latência, custo por token e privacidade. Se o modelo for local, você mantém os dados dentro da infraestrutura.

Teste o deploy com o mesmo conjunto de validação. O comportamento em produção pode mudar por causa de temperatura, top_p e tamanho máximo de resposta. Registre a configuração usada.

Passo 10: Itere, monitore e evite alucinações

Fine-tuning não é projeto de uma vez. Colete feedback, identifique erros e adicione exemplos. Monitore alucinações. Dados ruins ensinam o modelo a alucinar. Se o problema for falta de informação atualizada, complemente com RAG.

Uma arquitetura madura separa as camadas: fine-tuning para estilo e formato, RAG para conhecimento vivo, regras de negócio para validação. Assim você reduz risco e mantém o modelo útil por mais tempo.

Dicas para um fine-tuning que funciona

Comece com um problema pequeno e mensurável. Documente cada versão do dataset. Use validação cruzada quando possível. Prefira modelos abertos se privacidade for crítica. Teste antes de escalar. E lembre: o dataset vale mais que o hiperparâmetro da moda.

Erros comuns

Dados duplicados ou inconsistentes. Dataset pequeno demais para tarefa complexa. Full fine-tuning sem necessidade. Ignorar a loss de validação. Não testar com casos reais. Achar que fine-tuning substitui RAG. E esquecer que o modelo final precisa de monitoramento contínuo.

FAQ

O que é fine-tuning em LLMs?

Fine-tuning em LLMs é o treinamento adicional de um modelo já pronto com dados específicos. O ajuste fino de LLM adapta comportamento, formato e tarefa sem treinar do zero.

Preciso de GPU potente para fazer fine-tuning?

Depende da técnica. LoRA e QLoRA reduzem muito a necessidade de VRAM. Full fine-tuning exige hardware mais caro. Para modelos de 7B, LoRA em uma GPU de nuvem costuma ser viável.

Qual a diferença entre fine-tuning e RAG?

Fine-tuning muda o comportamento do modelo. RAG fornece conhecimento externo no momento da resposta. Muitas aplicações usam os dois juntos.

Quantos exemplos preciso no dataset?

Não existe número mágico. Tarefas simples podem funcionar com centenas de exemplos bem feitos. Tarefas complexas pedem mais dados e avaliação cuidadosa.

Fine-tuning causa alucinações?

Pode piorar alucinações se o dataset tiver erros ou se o modelo for forçado a inventar. Dados limpos, avaliação e RAG para fatos ajudam a controlar o problema.