Minima-KV: compressão de cache KV em 3,5x para LLMs de contexto longo

Técnica de formato misto reduz memória de atenção e sustenta performance em benchmarks de contexto estendido

Por Marcos Guimarães26 ago 2026
Minima-KV: compressão de cache KV em 3,5x para LLMs de contexto longo

O que aconteceu

O Minima-KV, técnica de compressão de cache KV para modelos de linguagem de contexto longo, foi apresentado em um artigo submetido ao arXiv em 24 de agosto de 2026 (arXiv:2608.23834). No estudo, o Minima-KV é descrito como uma hierarquia de preservação de retenção para atenção paginada de formato misto. O método combina duas representações: páginas recentes e protegidas, chamadas Anchor, permanecem em FP8, enquanto páginas antigas não-anchor são movidas para um formato empacotado TQ3.

De acordo com o paper, cada página de requisição ativa permanece endereçável. Kernels específicos de cada formato calculam estados parciais de atenção e os combinam por meio de um merge online-softmax normalizado globalmente, permitindo decode heterogêneo direto sem exigir uma sombra densa com o tamanho do cache.

Os testes usaram perfis separados e configurados do Qwen3.6-27B em uma única GPU NVIDIA RTX PRO 6000 Blackwell de 96 GB. O relatório de implantação indica 18,3 KiB de KV de atenção por token vivo, o que corresponde a 3,50x de compressão em relação ao BF16 e 1,75x em relação ao FP8.

Contexto

O cache KV (key-value) é um gargalo de capacidade e largura de banda no atendimento de LLMs com contexto longo. Cada token processado gera pares de chaves e valores que ficam armazenados para reuso nas camadas de atenção, e esse armazenamento cresce linearmente com o tamanho do contexto e o número de camadas. Em produção, isso se traduz em mais memória e menor throughput por GPU.

O Minima-KV, apresentado pelo paper na área de Inteligência Artificial do arXiv, ataca esse gargalo usando uma hierarquia de formatos, em vez de simplesmente descartar tokens antigos. A ideia é manter a informação de atenção mais recente em precisão maior e compactar o restante, sem evictar páginas de requisições vivas.

Por que importa

O resultado tem impacto direto em quem opera LLMs de contexto longo. Com 18,3 KiB por token vivo, um modelo como o Qwen3.6-27B pode atender janelas maiores em uma mesma GPU, ou dedicar a memória economizada a mais requisições simultâneas. Para provedores de infraestrutura de IA, isso pode reduzir o custo por token servido.

A qualidade também é relevante. No benchmark RULER de agulha no palheiro com 16K, o perfil de qualidade materializado do Minima-KV igualou o controle denso. No LongBench v2, conjunto com 503 perguntas, os deltas medidos foram de -0,80, -0,60 e -0,40 pontos percentuais em contextos de 16K, 32K e 64K, respectivamente, segundo o artigo.

Impacto

Em um teste canário de decode direto com par único, envolvendo duas requisições de 59.008 tokens, o Minima-KV alcançou 3,625x de compressão ativa de KV e manteve throughput de 0,9821x em relação ao controle. Isso significa uma queda de menos de 2% na velocidade, ainda que todas as 16 camadas de atenção completa tenham sido roteadas sem fallback e sem retenção de sombra densa.

O canário, relatado no paper, confirma que a compressão ativa não força a exclusão de páginas de requisições ativas. Em termos práticos, para uma empresa que serve chatbots ou agentes com histórico longo, a técnica permite manter mais contexto por requisição ou acomodar mais usuários por GPU, com impacto mínimo na latência.

O que muda

O Minima-KV, diferentemente de métodos que simplesmente descartam tokens, preserva a capacidade de endereçamento de todas as páginas vivas. Isso muda o jogo para serving de long-context, porque a compactação acontece em formato misto e sem precisar de um cache sombra denso, que consumiria memória extra.

O paper não informa disponibilidade de código ou integração com bibliotecas de inferência. Mesmo assim, os resultados estabelecem um caminho prático para comprimir estado de contexto longo sem evictar páginas KV de requisições ativas, o que pode influenciar futuras implementações em frameworks de serving.

O que vem agora

O artigo está disponível no arXiv com a versão submetida em 24 de agosto de 2026. Não há anúncio de lançamento público do código ou de compatibilidade com ferramentas como vLLM ou TensorRT-LLM. O próximo passo esperado é a validação independente por outros grupos, além de possíveis extensões para outros modelos e arquiteturas.

Para o mercado brasileiro de tecnologia, que usa cada vez mais LLMs em produtos de atendimento e análise, a redução de memória por token pode baratear a operação de modelos de grande porte, especialmente em GPUs com capacidade limitada.

Fontes