LinearKV: um único estado em cache basta para LLMs híbridos
Framework do arXiv adapta caching posicional a modelos híbridos e recupera até 92% da qualidade
Um paper submetido ao arXiv em 31 de julho de 2026 propõe o LinearKV, um framework de caching sem treinamento para LLMs híbridos, que misturam atenção plena com recorrências lineares. O trabalho mostra que um único estado em cache por camada linear recupera até 92% da qualidade do prefill completo. Na prática, a técnica reduz a latência da primeira resposta sem exigir ajustes no modelo.
O que aconteceu
Pesquisadores submeteram ao arXiv, em 31 de julho de 2026, o paper 'LinearKV: One Cached State Suffices for Position-Independent Caching in Hybrid LLMs' (arXiv:2608.11231v1). O trabalho apresenta o LinearKV, um framework sem treinamento que adapta o position-independent caching (PIC) a modelos híbridos. O insight central é uma inicialização desacoplada: cada camada linear mapeia os K estados locais correspondentes para um único estado inicial, enquanto as camadas de atenção plena continuam concatenando seus KV como nos métodos PIC tradicionais (fonte: arXiv).
A pesquisa compara duas abordagens: a do LinearKV, que usa um único estado em cache como inicializador, e a composição exata de todos os K estados para reconstruir o estado do prefixo completo, como faz o trabalho concorrente HYPIC. Nos dois modelos GDN testados, as abordagens empatam, recuperando até 92% da qualidade total. No modelo Mamba-2, a composição exata colapsa sob todos os seletores avaliados: no EPIC, por exemplo, recupera apenas 46,6% da qualidade total, contra 86,8% do inicializador com um único bloco em cache (fonte: arXiv).
Contexto
Position-independent caching (PIC) acelera a execução de LLMs ao reutilizar blocos de tokens cacheados, independentemente da posição original. Os métodos existentes foram construídos para modelos full-attention, em que a cache KV é indexada por token: eles combinam chunks reutilizáveis, concatenam entradas KV e recomputam seletivamente alguns tokens para restaurar o contexto entre blocos. Modelos híbridos quebram essas operações ao substituir a maioria das camadas de atenção por recorrências lineares, que expõem apenas um estado de tamanho fixo — sem cache KV indexada por token para concatenar ou reparar localmente. O LinearKV responde à pergunta de se o PIC pode beneficiar esses modelos e o que seria necessário para isso.
Por que importa
Arquiteturas híbridas, como Mamba-2 e modelos GDN, combinam a eficiência das recorrências com a qualidade da atenção e já circulam em sistemas de serving de LLM. Até agora, o PIC não tinha um caminho claro para funcionar nelas. O LinearKV indica que reconstruir o contexto de prefixo completo não exige compor todos os estados cacheados — um único estado inicial resolve, com custo menor. Isso tem efeito direto na operação de quem serve LLMs: o tempo até o primeiro token cai para 0,46x do prefill completo, e a composição exata adiciona ainda 5% a 17% de overhead (fonte: arXiv). Para provedores de IA no Brasil, que lidam com custo de inferência por requisição, técnicas que reduzem latência sem retreinar modelos são relevância imediata.
Impacto
No curto prazo, o resultado contraria a intuição de que a composição exata dos estados seria a abordagem correta — em algumas arquiteturas, ela é pior. O caso Mamba-2 é o mais claro: a composição exata recuperou 46,6% da qualidade total no seletor EPIC, ante 86,8% do estado único. No médio prazo, o custo menor por requisição de cache e a queda no time-to-first-token tendem a beneficiar sistemas de inferência que operam com contextos longos, já que os resultados foram validados em LongBench QA e RULER com janelas de 8K a 32K tokens (fonte: arXiv).
O que muda
O desenho de caching para modelos híbridos deixa de exigir o gerenciamento de múltiplos estados lineares por camada. Como o LinearKV é compatível com métodos PIC existentes — reutilizando a seleção de tokens e a recomputação sem alterações —, a adoção pode ser incremental em sistemas que já usam PIC em modelos full-attention.
O que vem agora
O paper foi anunciado no arXiv em 13 de agosto de 2026, após submissão em 31 de julho. O anúncio não informa planos de código aberto ou integração comercial. Os próximos passos esperados são a avaliação pela comunidade, eventuais implementações públicas e testes em outros modelos híbridos e seletores de PIC.
Fontes
- arXiv (cs.AI) — 'LinearKV: One Cached State Suffices for Position-Independent Caching in Hybrid LLMs' — https://arxiv.org/abs/2608.11231
