SAPO: otimização de prompts por segmentos supera métodos monolíticos

Pesquisa no arXiv decompõe prompts em quatro partes e melhora média em cinco benchmarks com GPT-3.5-Turbo e GPT-4o-mini

Por Redação Mapa Paper13 ago 2026
SAPO: otimização de prompts por segmentos supera métodos monolíticos

O que aconteceu

A pesquisa “From Monolithic to Modular: Segment-level Automatic Prompt Optimization”, de Artur Khairullin, foi submetida ao arXiv em 21 de julho de 2026 (arXiv:2608.11219, área de Inteligência Artificial). O trabalho apresenta o SAPO (Segment-level Automatic Prompt Optimization), método que decompõe prompts em quatro segmentos — papel (role), contexto, tarefas e formato de saída — e aplica melhorias direcionadas com base nos cinco melhores e cinco piores exemplos (top-5 e bottom-5).

O loop de otimização usa um único LLM, com meta-prompts estáticos e saídas estruturadas, para fazer a segmentação, analisar fraquezas e gerar candidatos. A geração de novos prompts acontece em duas etapas: diagnóstico por segmento com extração de recomendações e síntese de candidatos guiada pelos sinais dos segmentos fortes e fracos.

Na avaliação, feita em cinco conjuntos de dados — SQuADv2, TweetEval, XSUM, CommonGen e GSM8K — com GPT-3.5-Turbo e GPT-4o-mini, o SAPO atingiu a melhor pontuação média contra Zero-shot e contra baselines fortes de APO: APE, OPRO, EvoPrompt, GEPA e StraGO (arXiv).

Contexto

A otimização automática de prompts (APO) cresceu como forma de reduzir o ajuste manual de instruções para modelos de linguagem. Métodos como APE, OPRO e EvoPrompt reescrevem o prompt como um bloco único. O problema, apontado no artigo, é que uma mudança que melhora um comportamento pode degradar outro — efeito colateral difícil de diagnosticar quando tudo é alterado ao mesmo tempo.

O SAPO ataca isso com uma abordagem modular: em vez de trocar o prompt inteiro, o método identifica qual segmento está fraco e propõe mudanças só ali. O artigo também descreve um protocolo de treino e validação, e o uso de saídas estruturadas torna cada decisão de otimização mais rastreável.

Por que importa

Para equipes que usam LLMs via API, o prompt continua sendo um dos principais pontos de ajuste de custo e qualidade. Um método que localiza o problema em um segmento específico reduz o retrabalho por tentativa e erro e facilita entender por que uma versão do prompt melhorou ou piorou. No Brasil, times que usam modelos como GPT em produtos e automações têm um motivo extra para acompanhar o método: a otimização usa um único LLM e não exige infraestrutura adicional.

Impacto

No curto prazo, o SAPO entra como um novo baseline para pesquisas de otimização de prompts e mostra que a segmentação por papel, contexto, tarefa e formato de saída é alternativa viável à reescrita monolítica. No médio prazo, a combinação de meta-prompts estáticos com saídas estruturadas pode ser incorporada a pipelines de avaliação contínua de prompts, tornando a otimização mais explicável e menos propensa a regressões.

O que muda

A mudança central é de abordagem: sai a otimização do prompt completo, que atua como caixa-preta, e entra o diagnóstico por partes. O usuário passa a saber qual segmento está segurando o desempenho — o contexto, a definição da tarefa ou o formato de saída — e o ajuste fica restrito a ele.

O que vem agora

O artigo está na versão v1, disponível no arXiv, e o método pode ser replicado por terceiros usando um único LLM e meta-prompts estáticos. Os autores não anunciaram próximos passos na versão atual; o esperado é que o SAPO seja avaliado em mais modelos e conjuntos de dados pela comunidade de pesquisa.

Fontes

  • arXiv cs.AI — “From Monolithic to Modular: Segment-level Automatic Prompt Optimization” (arXiv:2608.11219) — https://arxiv.org/abs/2608.11219
SAPO: otimização de prompts por segmentos supera métodos monolíticos | The Mapa Paper